Menu

Dopo aver passato il riconoscimento degli indirizzi al modello GPT-5, il tasso di errori 429 è sceso dal 13% allo 0,2%, ma abbiamo incontrato due problemi inaspettati.

Lo scorso mese, la grande promozione di Black Friday è appena terminata, e noi tre sviluppatori del backend abbiamo passato ben 72 ore consecutive a monitorare i dati: l’anno scorso, il 13% delle richieste di analisi degli indirizzi ha incontrato problemi di limitazione del traffico (429 errori), ma quest’anno questo problema non si è più verificato. L’unica modifica principale apportata è stata quella di sostituire tutti i modelli generici utilizzati in precedenza con il modello GPT-5 per il trattamento strutturato degli indirizzi.

Per chi non l’ha ancora provato, spiego chiaramente: cosa rappresenta esattamente GPT-5 per scenari come il nostro.

Si tratta del nuovo modello multimodale di OpenAI, rilasciato quest’anno, e l’unico parametro che ci è davvero utile è l’ancora dei parametri (parameter anchor).Il limite massimo di richieste di elaborazione strutturata supportato per un singolo account al minuto è 12 volte superiore rispetto al modello precedente.Inoltre, il tasso di riconoscimento degli input non standard è aumentato di un ordine di grandezza.

Ci occupiamo di logistica transfrontaliera in Europa e ogni giorno gestiamo 500.000 indirizzi forniti dagli utenti. Molte persone mescolano strade, codici postali e città, oppure aggiungono emoji a caso o scrivono le informazioni in modo errato. I modelli precedenti o non riconoscevano correttamente questi indirizzi o richiedevano l’accesso a tre interfacce diverse per ottenere i risultati desiderati. Quando c’è un aumento improvviso del traffico, il sistema subisce facilmente limitazioni di funzionamento.

Dopo il passaggio a GPT-5, abbiamo ottenuto effettivamente 3 benefici concreti.

Il primo aspetto più evidente: il problema del throttling viene risolto direttamente.Durante il picco della promozione, il tasso di errore 429 è sceso al 0,2%.Non dobbiamo nemmeno utilizzare una coda di modelli di riserva, il che ci permette di risparmiare il 30% del tempo di manutenzione che prima veniva impiegato per il bilanciamento del carico.

Il secondo aspetto che ha migliorato le prestazioni è l’aumento dell’accuratezza nel riconoscimento degli indirizzi: in precedenza, circa l’8% degli indirizzi richiedeva una verifica manuale secondaria, mentre ora questa percentuale è scesa al di sotto dell’1%. Di conseguenza, il team di assistenza clienti gestisce meno di 2000 richieste di correzione di indirizzi ogni settimana.

Il terzo punto, invece, non è stato menzionato molte volte: supporta il caricamento diretto di foto di ricevute scritte a mano per il riconoscimento, evitando la necessità di utilizzare servizi OCR separatamente per convertirle in testo. Questo semplifica il processo di due passaggi e la maggior parte delle richieste riceve i risultati in meno di 15 millisecondi; solo in casi molto rari, dove le foto sono poco chiare, il tempo di risposta potrebbe essere più lungo.

Non guardate solo i vantaggi: le due difficoltà che abbiamo incontrato molto probabilmente le incontrerete anche voi.

Detailed view of programming code in a dark theme on a computer screen.

Il primo problema riguarda l’adattamento alla grafia dei dialetti nelle aree di lingue minoritarie. Pensavamo che le capacità multilingue fossero sufficientemente avanzate, ma la scorsa settimana il tasso di errore nell’identificazione degli indirizzi in basco nella regione spagnola è aumentato improvvisamente al 12%. Dopo aver verificato, abbiamo scoperto che i dati di addestramento contenevano pochi esempi di indirizzi in questi dialetti minoritari. Pertanto, abbiamo dovuto aggiungere delle regole locali per gestire questa situazione.

Il secondo problema riguarda i costi. Inizialmente avevamo calcolato che il costo per ogni token di una singola richiesta fosse aumentato del 20% rispetto alla generazione precedente, ma avevamo dimenticato che i campi strutturati restituiti in modo predefinito fossero aumentati di 3. Di conseguenza, il costo effettivo per i token era aumentato del 40%. Successivamente, abbiamo impostato i campi restituiti nel prompt in modo da includere soltanto i 5 necessari, riuscendo a ridurre i costi a un aumento del 10% rispetto al livello precedente.

Quali squadre dovrebbero agire immediatamente e quali invece non hanno affatto bisogno di intervenire?

  • Ci sono più di 100.000 richieste al giorno per il trattamento strutturato di testi e immagini non standardizzati. Per le aziende di medie e piccole dimensioni che operano in settori come e-commerce, logistica o gestione delle richieste di assistenza clienti e che in precedenza hanno incontrato problemi a causa del limitazione del traffico impostata dai modelli e di una precisione insufficiente, l’utilizzo di questo nuovo sistema porterà a un ritorno sull’investimento (ROI) molto evidente.
  • Ciò che non dovrebbe essere utilizzato: per semplici attività di domande e risposte, generazione di contenuti, o per team con meno di 10.000 richieste al giorno, non c’è assolutamente bisogno di spendere soldi per questo. Il modello precedente è più che sufficiente e può addirittura permettere di risparmiare notevoli costi.

Due consigli specifici per chi inizia per la prima volta

Prima di tutto, utilizza le tue richieste storiche degli ultimi 7 giorni per creare un set di test. Non limitarti solo ai campioni forniti ufficialmente; in particolare, per i contenuti relativi a lingue minoritarie o aree poco popolari, assicurati di eseguire il test per verificare l’accuratezza dei risultati. Altrimenti, scoprire errori di valutazione solo dopo il lancio del prodotto potrebbe rivelarsi molto problematico.

In secondo luogo, la prima volta che esegui la chiamata, inserisci direttamente nei parametri di input (prompt) i campi di ritorno che hai bisogno; non lasciare che il sistema generi contenuti in modo casuale, altrimenti il contenuto aggiuntivo consumerà una notevole quantità di risorse (token) inutilmente.

Qualcuno chiede: È ancora necessario fare la coda per richiedere l’uso di GPT-5?

Siamo account di sviluppatori aziendali: i requisiti di verifica vengono esaminati entro 3 giorni dalla presentazione della documentazione. Gli sviluppatori individuali, invece, potrebbero dover aspettare da 1 a 2 settimane. In caso di necessità urgente, è disponibile un canale verde per le aziende che permette l’attivazione immediata dello account nello stesso giorno.

È stato utile?

Supporto tecnicoAssistenza online
侧栏
Torna in alto
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR