Menu

Abbiamo aumentato al massimo la precisione del matching degli indirizzi logistici utilizzando OpenAI o1, ma abbiamo incontrato tre problemi inaspettati.

Appena è passato il picco del Black Friday della scorsa settimana, il nostro team di sviluppo backend in Europa ha finalmente potuto tirare un sospiro di sollievo: lo scorso anno, il 13% delle richieste di risoluzione degli indirizzi ha incontrato problemi a causa dei limiti imposti da un singolo modello, che causavano il rifiuto delle richieste (429 error code). Quest’anno non solo non si è verificato nessun caso di limitazione, ma anche il tasso di errori nella corrispondenza degli indirizzi è diminuito del 82%. Il cambiamento principale è stato l’adozione del modello di ragionamento o1.

Per spiegarlo chiaramente a chi non ne ha mai sentito parlare: cos’è esattamente l’o1?

È il grande modello di ragionamento potenziato lanciato da OpenAI, che si differenzia da GPT-4o in quanto impiega più tempo per “pensare” a problemi logici complessi. Il punteggio ottenuto nei test di capacità di ragionamento di base, secondo le informazioni ufficiali, è addirittura del 87% più alto rispetto a GPT-4o, ed è proprio questo aspetto che ci ha spinto a sceglierlo fin dall’inizio.

Per squadre di piccole e medie dimensioni come la nostra, i vantaggi di o1 sono davvero concreti.

Il primo vantaggio risolve direttamente il problema più fastidioso per noi, ovvero il corretto abbinamento degli indirizzi. Quando utilizzavamo GPT-4o, spesso capitava di confondere strade con lo stesso nome o codici postali in diversi paesi europei, soprattutto quando gli utenti inserivano indirizzi con errori di battitura. Per raggiungere un tasso di accuratezza del 92%, eravamo costretti ad applicare tre livelli di verifica delle regole. Ora, con o1, il tasso di accuratezza è salito direttamente al 98,7%, e abbiamo già cancellato tutto quel codice di regole la scorsa settimana.

Il secondo aspetto positivo è che non è più necessario creare complessi progetti di generazione di prompt. In precedenza, per far sì che il modello producesse risultati di analisi in conformità con il formato del nostro backend, abbiamo scritto prompt lunghi quasi 2000 parole, e spesso si verificavano problemi di formato non corretto nelle output. Ora basta una singola istruzione per risolvere tutto, riducendo notevolmente i costi di manutenzione dei prompt a zero.

Il terzo aspetto positivo è che la stabilità delle richieste concorrenti è migliore di quanto ci aspettassimo. Inizialmente temevamo che i lunghi tempi di elaborazione potessero causare code di attesa, ma i dati di monitoraggio mostrano che la maggior parte delle richieste viene completata in meno di 15 millisecondi; solo un numero esiguo di richieste particolarmente complesse, che coinvolgono indirizzi internazionali, richiede più di 200 millisecondi, il che rientra comunque entro i limiti accettabili per noi.

Ma i suoi trucchi possono davvero coglierti di sorpresa e metterti in difficoltà.

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

Il primo problema è che il consumo di token è molto più elevato rispetto a GPT-4o. Nei primi 3 giorni in cui abbiamo passato a GPT-4o, i costi di elaborazione sono aumentati di 2,3 volte; solo in seguito abbiamo scoperto che GPT-4o include anche i propri processi di ragionamento nel calcolo del consumo di token. Se non hai bisogno di vedere il ragionamento sottostante alle risposte fornite, devi assolutamente disattivare l’output di tali processi nei parametri di chiamata. Dopo averlo fatto, i costi sono tornati al livello precedente (1,2 volte), il che è completamente accettabile.

Il secondo problema è che il metodo non è adatto per richieste semplici e frequenti. All’inizio, per comodità, abbiamo indirizzato tutte le richieste di ricerca di indirizzi a o1, ma abbiamo scoperto che per gli indirizzi che non presentavano errori di battitura o che erano in formato standard, l’accuratezza non differiva tra l’uso di o1 e di GPT-4o; inoltre, questo ha comportato costi aggiuntivi. Ora abbiamo aggiunto un semplice controllo preliminare: solo le richieste che non seguono il formato standard vengono indirizzate a o1, il che ha ridotto i costi del 30%.

Il terzo problema è che il supporto per gli input in lingue non latine, come il cinese e l’arabo, non è ancora abbastanza stabile. Abbiamo un numero limitato di utenti provenienti dal Medio Oriente che utilizzano l’arabo per inserire indirizzi, e occasionalmente si verificano errori di analisi. Dopo aver segnalato questo problema a OpenAI, stiamo ancora aspettando una correzione; per il momento, utilizziamo regole locali per effettuare ulteriori verifiche.

Chi dovrebbe usare l’o1? Chi non deve toccarlo in questo momento?

Se stai lavorando su compiti che richiedono ragionamento logico – come l’abbinamento di regole complesse, la verifica di molteplici condizioni o la generazione di codice semplice – e hai già raggiunto un limite di accuratezza utilizzando GPT-4o, allora passare direttamente a GPT-4o1 potrebbe rivelarsi una scelta molto vantaggiosa in termini di rapporto qualità-prezzo.

Ma se stai facendo semplice classificazione del testo, generazione di contenuti o richieste di standardizzazione frequenti, allora non c’è assolutamente bisogno di usare o1: è solo uno spreco di soldi; GPT-4o o anche GPT-3.5 possono farcela benissimo.

2 consigli per chi utilizza il prodotto per la prima volta

  • Prima di tutto, utilizziamo i 1000 dati storici che hai già elaborato con il modello vecchio per fare un test. Non effettuare il passaggio completo all’improvviso; in questo modo potrai vedere rapidamente se l’aumento dell’accuratezza sia in grado di compensare l’aumento dei costi. Abbiamo effettuato i test per 2 giorni e abbiamo deciso di cambiare il modello subito dopo.
  • Quando si effettua una chiamata, viene preferita la versione o1-mini. Per il 90% dei casi in cui si tratta di piccole e medie aziende, le funzionalità di o1-mini sono più che sufficienti, e inoltre il prezzo è del 60% più conveniente rispetto alla versione completa di o1.

Ultima domanda che tutti fanno con molta frequenza: o1 verrà presto sostituito da altri modelli? Almeno nel contesto dell’analisi degli indirizzi che stiamo lavorando, abbiamo testato tutti i principali modelli di ragionamento disponibili sul mercato e nessuno di loro ha raggiunto l’accuratezza di o1; quindi, per almeno i prossimi sei mesi, rimarrà la nostra scelta preferita.

È stato utile?

Supporto tecnicoAssistenza online
侧栏
Torna in alto
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR