Menü

Mit o1-mini haben wir die Lieferkettenprognose durchgeführt: Wir haben 62 % der Rechenkosten eingespart, aber sind auf zwei tödliche Fehler gestoßen.

Letzten Monat, während des Black Friday, wäre unser Team fast gescheitert.
Bisher wurden große Modelle verwendet, um die Lagerverteilungsanforderungen für die nordamerikanische Region vorherzusagen. Während der Spitzenzeiten wurden für mehr als 3 Tage in Folge über 18 Prozent der Anfragen direkt mit dem Fehlercode 429 abgewiesen. Dadurch wurde das Lagerplanungssystem der Betriebsabteilung so durcheinandergebracht, dass beliebte Produkte in drei Bundesstaaten 48 Stunden später ausgeliefert wurden.
Die Anforderung nach einem Modeländerung wurde damals direkt mit dem Code „P0“ gekennzeichnet. Wir haben sieben Tage damit verbracht, vier Alternativen zu testen und schließlich das Modell „o1-mini“ ausgewählt. Seitdem läuft das System nun seit 22 Tagen ohne Probleme – allerdings sind wir auf einige Fallstricke gestoßen, von denen niemand im Voraus gesprochen hatte.

Für diejenigen, die es noch nicht wissen: Was genau ist o1-mini?

Es handelt sich um das von OpenAI entwickelte leichte Inferenzmodell, das speziell auf die Beschleunigung der Verarbeitung von logischen und rechenintensiven Aufgaben abgestimmt ist.Die grundlegenden Rechenfähigkeiten unterscheiden sich um nicht mehr als 8% von denen der leistungsstärksten großen Modelle, und die Kosten pro Token betragen nur ein Siebtel der Kosten der leistungsstärksten Modelle.。
Wir haben von Anfang an auf diesen Kostenvorteil abgezielt, schließlich müssen bei unserer Vorhersageaufgabe mehr als 3000 historische Bestelldaten, Wetterinformationen und Feiertagsdaten pro Durchgang eingegeben werden, und die Prozesse werden fast 20.000 Mal pro Tag ausgeführt.

Die drei offensichtlichsten Vorteile haben wir tatsächlich erzielt.

  • Zuerst ist das Problem mit der Bandbreitendrosselung vollständig beseitigt: Der Einzelkonto-Drosselungswert für o1-mini ist 12-mal so hoch wie der Wert des Modells, das wir zuvor verwendet haben. Selbst am Black Friday, wenn die Spitzenbelastung erreicht wird, ist es noch nie zu einem Fehler „429“ gekommen, und die Ausgabe der Pläne seitens der Betriebsabteilung erfolgt ohne jegliche Verzögerung.
  • Die Kosten sind deutlich gesunken: Laut den Rechnungsdaten aus unserem Backend ergeben die Ausführung derselben Vorhersageaufgaben deutlich geringere Kosten.Die monatlichen Rechenkosten sind von 12.000 US-Dollar auf 4.500 US-Dollar gesunken.Mit dem gesparten Geld haben wir direkt drei weitere Echtzeit-Datenspeicherplätze hinzugefügt.
  • Die Geschwindigkeit ist so hoch, dass Echtzeitanpassungen möglich sind: Frühere Modelle benötigten mehr als 20 Sekunden für eine Vorhersage, während die meisten Anfragen jetzt innerhalb von 15 Millisekunden abgewickelt werden. Wir haben die Aktualisierung der Vorhersagedaten nun auf alle 2 Stunden angepasst – anstatt wie zuvor einmal täglich. Dadurch ist die Ausfallrate um direkt 4 Prozentpunkte gesunken.

Aber es gab zwei Probleme, und wir hätten beinahe direkt einen Rückschritt gemacht, als wir darauf gestoßen sind.

Abstract representation of a multimodal model with dots and lines on a white background.

Der erste Fehler ist, dass die Fähigkeit, unstrukturierte Daten zu verarbeiten, extrem schlecht ist.
In unseren vorherigen Eingaben waren einige Schlüsselwörter aus den Diskussionen der Nutzer in sozialen Medien enthalten, die als Referenz für Schwankungen der Nachfrage dienten. Leider hat o1-mini diese Inhalte als ungültige Informationen eingestuft, wodurch die vorhergesagten Daten der letzten drei Tage um 20% niedriger ausfielen als die tatsächliche Nachfrage. Glücklicherweise verfügen wir über ein Überprüfungsverfahren, sodass wir die Daten nicht tatsächlich für die Bestellvorbereitung verwendet haben.
Zum Schluss können wir nur noch ein kleines Textanalysemodell einzeln ausführen, um diese Daten zu verarbeiten, sie in strukturierte Bewertungswerte umzuwandeln und diese anschließend an o1-mini zu übergeben, um das Problem zu lösen.

Der zweite Fehler ist, dass die Mehrsprachigkeitsverarbeitung unausgesprochene Vorurteile aufweist.
In unseren Prognosen für die kanadische Region enthalten sich französische Ortsnamen und Produktnamen. Standardmäßig wird o1-mini einige französische Kategorien in englische Äquivalente umwandeln, was dazu führt, dass die Prognosen für Skiausrüstung in der Region Québec um die Hälfte reduziert werden. Erst nachdem wir eine Regel hinzugefügt hatten, die die Beibehaltung der ursprünglichen Sprachangabe vorschreibt, konnten wir dieses Problem beheben. In den offiziellen Dokumenten wird dieses Problem jedoch überhaupt nicht erwähnt.

Wer es verwenden sollte und wer nicht, das haben wir für Sie bereits geklärt.

Wenn Sie genauso wie wir arbeiten…Logische Schlussfolgerungen, numerische Berechnungen, Entscheidungen auf Grundlage von RegelnFür Aufgaben, die eine hohe Strukturiertheit der Eingaben erfordern und bei denen Anforderungen an Kosten sowie Konkurrenzfähigkeit groß sind, ist o1-mini im Grunde eine sichere Wahl – man kann sie ohne Bedenken verwenden.
Aber wenn du Inhaltsgenerierung, multimodales Verständnis oder komplexe Mehrsprachenaufgaben durchführen willst, dann lass es lieber bleiben – die Ergebnisse können eine Menge unerwarteter Fehler verursachen, und die Kosten für die Fehlerbehebung übersteigen die eingesparten Gelder.

Zwei konkrete Ratschläge für Anfänger

Zunächst muss vor der Live-Veröffentlichung mindestens eine 7-tägige Parallelüberprüfung durchgeführt werden, bevor der Traffic direkt umgeleitet wird.
Zu Beginn wollten wir es uns einfach machen und haben nur drei Tage durchgeführt, und glücklicherweise sind wir auf keine Szenarien mit französischen Eingaben gestoßen, sonst wären große Probleme entstanden. Ein Zyklus von sieben Tagen deckt im Grunde die meisten Randfälle in Ihrem Geschäft ab.

Zweitens: Verändern Sie die Temperaturparameter nicht willkürlich.
Zuerst wollten wir das Ergebnis flexibler gestalten und haben die Temperatur auf 0,7 eingestellt. Leider waren die daraus resultierenden Vorhersagedaten so unbeständig, dass sie nicht nutzbar waren. Erst als wir die Temperatur wieder auf den von den Entwicklern empfohlenen Bereich von 0,1 bis 0,3 einstellten, wurden die Daten stabil. Die Aufgabe der Lokalisierung besteht darin, bestimmte Schlussfolgerungen zu ziehen – für Kreativität eignen sich größere Modelle besser.

Zum Schluss noch eine häufig gestellte Frage: Soll man auf die nächste Version warten?
Zumindest im Bereich der Lieferkettenprognose ist das aktuelle o1-mini bereits ausreichend. Wir haben berechnet, dass selbst wenn die nächste Generation 20 Prozent günstiger wäre, dies nicht den gesparten Personalausgaben und Fehlerrisiken entspricht. Je früher wir es einsetzen, desto früher können wir Gewinne erzielen.

War das hilfreich?

Technischer SupportLive-Support
侧栏
Nach oben
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR