Abbiamo ridotto il tasso di errori nelle richieste durante la stagione promozionale al 0,2% grazie a GPT-4 Turbo; evitate di commettere questi 3 errori comuni.
Durante la promozione del Black Friday dello scorso mese, il nostro piccolo team di logistica transfrontaliera europea, composto da 3 persone, per la prima volta non è stato sommerso da richieste di verifica degli indirizzi dei clienti al punto di dover lavorare tutta la notte.
Lo scorso anno utilizzavamo ancora il normale GPT-4 per la standardizzazione degli indirizzi; durante i periodi di punte, il 13% delle richieste restituiva direttamente l’errore 429, e abbiamo impiegato ben 36 ore solo per gestire le lamentele dei clienti. Quest’anno, passando a GPT-4 Turbo, non si è verificato nemmeno un singolo caso di limitazione del traffico, e il tasso di errori è stato ridotto drasticamente.0.2%。
Prima di tutto: cos'è esattamente il GPT-4 Turbo?
In parole semplici, OpenAI ha sviluppato una versione di GPT-4 con un maggior throughput, basata sulle ottimizzazioni apportate a GPT-4. Il parametro chiave che ne caratterizza il funzionamento è...Il numero di richieste supportate al minuto da un singolo account è sei volte superiore a quello del normale GPT-4.Inoltre, il costo per singolo token è stato ridotto della metà; questa ottimizzazione è stata realizzata appositamente per scenari ad alta concorrenza.
3 vantaggi concreti per le piccole e medie squadre tecniche
Il primo vantaggio più evidente è che non dobbiamo più preoccuparci dei problemi legati al limitazione del traffico. Abbiamo circa 500.000 richieste di analisi di indirizzi al giorno e, in precedenza, dovevamo utilizzare tre modelli di intelligenza artificiale diversi su piattaforme diverse per il bilanciamento del carico. Solo per l’adattamento dei gateway abbiamo scritto più di 1.000 righe di codice. Ora, con l’uso di GPT-4 Turbo, riusciamo a gestire il traffico triplo durante le stagioni di promozioni.
Il secondo punto è l'alta efficienza nel trattamento di testi lunghi. Spesso dobbiamo inserire l'intera pagina di dichiarazioni di doganaggio transfrontalieri per estrarre le informazioni; in precedenza, il modello GPT-4 richiedeva di essere eseguito in 3 richieste a causa della mancanza di contesto sufficiente, ma ora è in grado di gestirlo tutto in una sola volta, riducendo di due terzi il tempo necessario per un singolo compito.
Il terzo vantaggio è davvero la riduzione dei costi. Abbiamo calcolato le fatture dello scorso mese e abbiamo scoperto che, con la stessa quantità di richieste, i costi di utilizzo di GPT-4 Turbo sono solo il 28% rispetto al precedente approccio basato su un mix di modelli diversi. Il risparmio ottenuto è stato utilizzato per aumentare il bonus di performance del team di due mesi.
Non guardare solo i vantaggi: questi 3 problemi li abbiamo già sperimentati.

Il primo problema è che le attività a bassa complessità possono rivelarsi meno vantaggiose di quanto si pensi. All’inizio abbiamo inoltrato tutte le richieste di verifica degli indirizzi, ma poi abbiamo scoperto che per quelle semplici, come verificare se un indirizzo appartiene all’Unione Europea, l’utilizzo di GPT-4 Turbo risultava tre volte più costoso rispetto all’uso di modelli più leggeri. Ora abbiamo reindirizzato queste richieste a modelli più semplici.
Il secondo problema è che il tempo di risposta predefinito è in realtà leggermente più lungo rispetto a quello del normale GPT-4. Quando abbiamo effettuato il passaggio, abbiamo notato che alcune richieste richiedevano più di 200 millisecondi per essere elaborate; in seguito abbiamo scoperto che, in modalità ad alta capacità di elaborazione, viene dato priorità al fatto che le richieste non vengano rifiutate, piuttosto che a un’ottimizzazione del tempo di risposta. Abbiamo risolto il problema impostando separatamente parametri per una bassa latenza per le richieste front-end che richiedono una risposta rapida.
Il terzo problema è che il controllo dei permessi a livello di dettaglio è più limitato. Il GPT-4 standard consente di personalizzare parametri come la “temperatura” del modello e il valore di “top_p” entro un intervallo molto preciso, mentre l’intervallo di regolazione del GPT-4 Turbo è notevolmente ridotto. Pertanto, per scenari che richiedono un controllo preciso dello stile di output (ad esempio, la creazione di testi per notifiche di dichiarazione doganale per i clienti), è ancora necessario tornare alla versione standard del modello.
Chi dovrebbe usarlo? E chi non ha bisogno di partecipare a questa “festa”?
Se sei un piccolo o medio team e soddisfi queste tre condizioni, procedi direttamente:
- Ogni giorno ci sono più di 100.000 richieste in contemporanea da parte di grandi modelli.
- Spesso è necessario lavorare su task di traduzione di testi lunghi che contengono più di 8.000 contesti.
- In passato, era spesso necessario utilizzare il bilanciamento del carico tra modelli a causa delle limitazioni di traffico.
Se il volume di richieste del vostro team è inferiore a 10.000 al giorno, o se si tratta solo di compiti semplici di classificazione ed estrazione dei dati, non c’è assolutamente bisogno di cambiare il modello: il modello leggero è più che sufficiente e inoltre è più economico.
Due consigli pratici per iniziare
Nella prima settimana, non effettuare il passaggio completo: inizialmente trasferisci il 10% delle richieste di testo di lunga durata e ad alta concorrenza per un test in modalità “grigia”. Dopo aver analizzato i dati di monitoraggio per una settimana, aumenta gradualmente la quantità di richieste. Il primo giorno abbiamo effettuato il passaggio del 30% dei dati, e per poco non abbiamo avuto problemi a causa di parametri non adeguati, che hanno causato errori nell’estrazione di alcune dichiarazioni doganali.
Non è necessario preparare un contesto troppo ampio in anticipo: il contesto di 128k di GPT-4 Turbo è sufficiente per gestire la stragrande maggioranza delle scenari a livello aziendale. Abbiamo provato a inserire l’intero contratto di logistica di 30 pagine per verificare i suoi termini, e l’accuratezza dell’output non è cambiata rispetto al trattamento in blocchi.
Due domande che tutti pongono spesso
Q: Sarà la qualità dell’output peggiore rispetto a quella del normale GPT-4?
A: Abbiamo eseguito un test su un set di 1000 dati di verifica degli indirizzi, con un tasso di accuratezza del 98,7%, che è quasi identico al 98,9% del GPT-4 standard. Questo è più che sufficiente per scenari aziendali.
Q: È necessario rifare il progetto Prompt?
A: Abbiamo semplicemente riutilizzato tutti i Prompt che avevamo scritto in precedenza per il GPT-4 standard, senza apportare alcun cambiamento, e il risultato ottenuto è stato esattamente come previsto.
Link dell’articolo:https://airai.cc/it/ai-news/31/
È stato utile?