Abbiamo utilizzato o3-mini per generare 1,2 milioni di richieste di descrizioni di prodotti, risparmiando il 62% dei costi di elaborazione.
Il mese scorso, poco prima del Black Friday, il nostro servizio di generazione di contenuti è quasi andato in tilt: il modello generale che utilizzavamo ha improvvisamente aumentato del 20% il suo costo, mentre il limite di traffico è stato ridotto della metà. Durante il picco delle prove, il 17% delle richieste ha ricevuto il codice di errore 429. Il team operativo ci ha pressato per sapere se le descrizioni di 12.000 prodotti scontati che dovevano essere pubblicate quel giorno sarebbero state pronte in tempo. Decidendo di dare una possibilità a questa soluzione, abbiamo reindirizzato il 30% del traffico verso il sistema o3-mini e, alla fine, non solo abbiamo superato con successo tutta la promozione, ma anche i costi sono risultati molto più bassi del previsto.
Prima di tutto, dobbiamo capire cosa sia esattamente o3-mini.
Questo è il modello di ragionamento leggero appena lanciato da OpenAI nel 2026 da Q1, che si concentra sulla generazione di contenuti strutturati e su attività di ragionamento semplici a bassa latenza, con una finestra di contesto massima di 128k e un costo di token di solo 1 / 8 di GPT-4o.
I 3 benefici più concreti che abbiamo ottenuto

- Durante il Black Friday, sono state generate 1,2 milioni di richieste per la descrizione dei prodotti.Il costo complessivo di elaborazione delle informazioni è diminuito del 62% rispetto all’uso precedente di GPT-4o.Non è stato attivato nemmeno un singolo meccanismo di limitazione del traffico; abbiamo accettato tutti i request, anche quelli di picco avvenuti un’ora prima dell’inizio della promozione.
- La maggior parte delle richieste riceve i risultati in meno di 18 millisecondi; in precedenza, a causa dell’uso di modelli più grandi, a volte si verificavano ritardi di alcuni centesimi di secondo. Abbiamo eliminato direttamente i messaggi di attesa per il caricamento dei contenuti sul lato client, e il tasso di conversione degli utenti è aumentato di 0,8 punti percentuali.
- La capacità di generazione multilingue integrata non richiede alcun adattamento da parte nostra; la precisione nella generazione di descrizioni in portoghese e spagnolo per i siti in America Latina è aumentata del 21% rispetto ai modelli più piccoli che avevamo ottimizzato in precedenza, eliminando la necessità che il personale operativo impieghi tempo per una seconda revisione.
Non affrettarti a fare il passaggio completo: abbiamo già incontrato alcuni problemi in precedenza.

Non usatelo per elaborare complesse logiche di raccomandazione di prodotti. All’inizio abbiamo provato a fornire al sistema la sequenza di navigazione degli utenti per generare testi di raccomandazione personalizzati, ma in 10 casi su 10 si verificavano errori di correlazione: ad esempio, le descrizioni di tende da esterno venivano mostrate accanto a informazioni su lampade da campeggio. Alla fine abbiamo deciso di riportare questa funzionalità al modello principale (il “modello grande”).
Inoltre, se il vostro business richiede l’utilizzo di strumenti, questi supportano attualmente solo fino a 3 chiamate in parallelo. Se il numero di chiamate supera questo limite, si verifichano problemi come l’esecuzione mancata di alcune operazioni o il ritorno di valori errati nei parametri. Durante le nostre query di inventario, si sono verificati diversi casi in cui i prezzi visualizzati erano imprecisi a causa di più di 2 chiamate agli strumenti. Ora, se il numero di chiamate agli strumenti supera 2, vengono automaticamente reindirizzate a un modello generale più potente.
Chi è adatto a usarlo, non ha affatto bisogno di provarlo.
Se il tuo scenario aziendale prevede la generazione di contenuti strutturati in batch, l'identificazione semplice delle intenzioni degli utenti o la risposta a domande frequenti (FAQ), soprattutto per piccole e medie imprese che non dispongono di risorse computazionali sufficienti per adattare i modelli in modo personalizzato, o3-mini rappresenta sicuramente una scelta ottimale in termini di rapporto qualità-prezzo.
Ma se devi eseguire il debug di codice complesso, effettuare ragionamenti logici in più fasi o analizzare in profondità documenti lunghi, è meglio scegliere un modello generico e affidabile. In questo caso, l’accuratezza delle risposte fornite da o3-mini diminuisce notevolmente, e inoltre richiede più tempo per verificare i risultati.
Due suggerimenti pratici per chi lo utilizza per la prima volta

Prima effettuare una fase di transizione graduale del traffico per 7 giorni, senza passare direttamente all’utilizzo completo del nuovo sistema. All’inizio abbiamo testato il nuovo sistema solo per le etichette dei prodotti non essenziali per 3 giorni, per verificare che il tasso di errori fosse entro i limiti accettabili, prima di procedere gradualmente con le funzionalità principali relative alle descrizioni dei prodotti, al fine di evitare problemi che potessero influenzare le attività online.
È possibile creare una semplice struttura di routing che classifichi le richieste in base alla loro complessità: le richieste semplici vengono elaborate dal sistema o3-mini, mentre quelle più complesse vengono automaticamente inviate al modello più potente. Questo approccio permette di risparmiare costi senza compromettere le prestazioni nelle situazioni più difficili. È esattamente quello che facciamo noi: il 90% delle richieste viene gestito da o3-mini, mentre il restante 10% viene elaborato dal modello più avanzato, riducendo così i costi complessivi di oltre la metà.
Problemi comuni
Domanda: Dovremmo fare dei piccoli aggiustamenti (micro-tuning) all’algoritmo o3-mini? Risposta: Se il tuo scenario riguarda la generazione di contenuti generici, non è affatto necessario; l’effetto originale è già sufficiente. Tuttavia, se il contesto contiene molti termini specifici di un determinato settore, puoi fornire alcune centinaia di esempi per eseguire il micro-tuning. Nel nostro caso, per la descrizione dei prodotti di autopezzo, il tasso di accuratezza è aumentato del 14% dopo il micro-tuning, con un aumento dei costi del solo 5%.
Domanda: La sicurezza dei dati è garantita? Risposta: Per impostazione predefinita, i modelli non vengono addestrati utilizzando i dati forniti dagli utenti. Se hai esigenze di conformità, puoi scegliere di utilizzare un’istanza dedicata, il che comporta un aumento dei costi del 30%, ma i dati saranno completamente isolati, rendendo questo approccio adatto al trattamento di contenuti relativi alla privacy degli utenti.
Link dell’articolo:https://airai.cc/it/ai-news/37/
È stato utile?