Menu

Eseguendo la previsione della catena di approvvigionamento con o1-mini, abbiamo risparmiato il 62% dei costi di elaborazione, ma abbiamo inciampato in due problemi critici.

Il mese scorso, durante il Black Friday, il nostro team è quasi andato in tilt.
Finora abbiamo utilizzato modelli di grandi dimensioni per prevedere le esigenze di distribuzione nei mercati nordamericani, e durante il picco del traffico, per tre giorni consecutivi, più del 18% delle richieste ha ricevuto il codice di errore 429. A causa di questo, i piani di approvvigionamento da parte del reparto operativo sono stati completamente sconvolti, con i prodotti più venduti in tre stati consegnati con 48 ore di ritardo.
La richiesta di cambiare modello è stata indicata direttamente con la codifica P0; abbiamo impiegato 7 giorni per testare 4 alternative, alla fine abbiamo scelto o1-mini. Da allora, dopo 22 giorni di utilizzo, tutti i problemi sono stati risolti, ma abbiamo anche incontrato delle difficoltà di cui nessuno ci aveva avvisato in anticipo.

Per chi non lo conoscesse, ecco una spiegazione su cosa sia esattamente o1-mini:

È il modello di inferenza leggero lanciato da OpenAI, appositamente ottimizzato per aumentare la velocità di esecuzione di compiti logici e computazionali.Le capacità di ragionamento di base differiscono di meno del 8% rispetto ai principali modelli di grandi dimensioni, e il costo per singolo token è solo un settimo di quello dei modelli principali.。
Siamo partiti proprio da questa differenza di costo, considerando che il nostro compito di previsione richiede l’input di oltre 3000 token di ordini storici, dati meteorologici e informazioni sui giorni festivi, e tutto questo viene elaborato quasi 20.000 volte al giorno.

I 3 benefici più evidenti li abbiamo ottenuti davvero.

  • Prima di tutto, il problema del throttling è completamente scomparso: il limite di utilizzo per un singolo account di o1-mini è 12 volte superiore a quello del modello che utilizzavamo in precedenza, e nemmeno durante il picco del Black Friday si è verificato alcun errore 429; inoltre, l’output pianificato dal team operativo è stato eseguito senza alcun ritardo.
  • I costi sono stati ridotti notevolmente: secondo i dati delle nostre fatture interne, eseguendo lo stesso compito di previsione,I costi di ragionamento per un singolo mese sono scesi da 12.000 dollari a 4.500 dollari.Con i soldi risparmiati, abbiamo aggiunto direttamente 3 nuovi punti di raccolta dei dati in tempo reale per i magazzini.
  • La velocità è così elevata da permettere aggiustamenti in tempo reale: i modelli precedenti richiedevano più di 20 secondi per eseguire una previsione, mentre ora la maggior parte delle richieste viene soddisfatta in meno di 15 millisecondi. Abbiamo modificato il sistema per aggiornare i dati di previsione ogni 2 ore, invece di una volta al giorno; di conseguenza, il tasso di mancanza di prodotti è diminuito di ben 4 punti percentuali.

Ma ci sono stati due problemi: quando li abbiamo risolti, per un soffio non abbiamo dovuto fare un rollback (un ripristino alle versioni precedenti del sistema).

Abstract representation of a multimodal model with dots and lines on a white background.

Il primo problema è la sua terribile capacità di gestire i dati non strutturati.
Nelle nostre precedenti analisi di input, c'erano alcuni termini di discussione degli utenti sui social media utilizzati come riferimento per i fluttuazioni delle richieste. Purtroppo, il sistema o1-mini ha considerato questi contenuti come informazioni non valide, e i dati previsti negli ultimi 3 giorni erano del 20% inferiori alle richieste effettive. Fortunatamente, abbiamo un meccanismo di verifica incrociata, quindi non abbiamo effettivamente effettuato l’ordine delle merci in base a quelle previsioni.
Alla fine, non ci resta che eseguire separatamente un piccolo modello di analisi del testo per elaborare questa parte dei dati, convertendola in valori strutturati da poi fornire a o1-mini, in modo da risolvere il problema.

Il secondo problema è che il suo trattamento multilingue presenta delle discrepanze nascoste (bias invisibili).
Nelle nostre previsioni per la regione del Canada, ci sono toponimi e nomi di prodotti in francese. Per impostazione predefinita, o1-mini mappa alcune categorie in francese in categorie equivalenti in inglese, il che comporta una riduzione del 50% dei valori previsti per l’attrezzatura da sci nella regione del Québec. Solo dopo aver aggiunto una regola che impone la conservazione dell’identificazione della lingua originale nei prompt, siamo riusciti a risolvere il problema. Questo problema non viene menzionato nemmeno di sfuggita nei documenti ufficiali.

Chi dovrebbe usarlo e chi no, abbiamo già tracciato i confini per te.

Se fai come noi, cioè lavori in…Razionamento logico, calcoli numerici, decisioni basate su regolePer compiti che richiedono un alto livello di strutturazione dei dati, costi elevati e concorrenza, l’opzione o1-mini è praticamente l’ideale da scegliere senza esitazione.
Ma se quello che vuoi fare è generare contenuti, comprendere informazioni in modi multipli o gestire linguaggi complessi, allora evita di usarlo: i risultati potrebbero essere pieni di errori inaspettati, e il costo per risolverli potrebbe superare di gran lunga i soldi che hai risparmiato.

Due consigli concreti per chi si avvicina per la prima volta

Prima di tutto, è essenziale eseguire almeno 7 giorni di verifica parallela prima di lanciare il servizio, senza passare direttamente al traffico reale.
All'inizio abbiamo voluto semplificare le cose e abbiamo eseguito il test per solo 3 giorni, fortunatamente senza incontrare situazioni in cui fosse necessario utilizzare il francese come lingua di input; altrimenti avremmo potuto avere seri problemi. Un ciclo di 7 giorni dovrebbe coprire la maggior parte delle situazioni “marginali” presenti nel tuo business.

In secondo luogo, non modificare a caso i suoi parametri di temperatura.
All'inizio volevamo rendere i risultati più flessibili, quindi abbiamo impostato la temperatura a 0,7; tuttavia i dati previsti risultavano troppo instabili per essere utilizzabili. Solo quando l'abbiamo riportata nell'intervallo consigliato ufficialmente, tra 0,1 e 0,3, i dati sono diventati stabili. Il compito principale di questo sistema è quello di eseguire ragionamenti deterministici; se si cerca creatività, è meglio utilizzare direttamente i grandi modelli.

Infine, una domanda che tutti fanno spesso: dobbiamo aspettare la prossima versione?
Almeno nel contesto della previsione della catena di approvvigionamento, l’attuale versione o1-mini è già sufficiente. Abbiamo calcolato che, anche se la prossima versione fosse più economica del 20%, non compenserebbe comunque i costi umani e i problemi tecnici che si evitano utilizzando l’attuale sistema. Più la si utilizza presto, più si guadagna.

È stato utile?

Supporto tecnicoAssistenza online
侧栏
Torna in alto
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR