Mit dem Mechanismus „o3-mini“ konnten wir 1,2 Millionen Anfragen zur Generierung von Produktbeschreibungen während des Black Friday-Events bewältigen und dabei 62% der Rechenkosten einsparen.
Vor dem Black Friday letzten Monats war unser Content-Generationsdienst beinahe zusammengebrochen: Das ursprünglich verwendete allgemeine Großmodell erhöhte plötzlich seinen Preis um 20%, gleichzeitig wurde der Throttling-Threshold um die Hälfte reduziert. Während des Testzeitraums erhielten 17% der Anfragen die Fehlermeldung „429“. Das Betriebsteam drängte darauf, zu erfahren, ob die Beschreibungen der 12.000 reduzierten Produkte, die an diesem Tag veröffentlicht werden sollten, pünktlich fertiggestellt werden könnten. Mit einer gewissen Risikobereitschaft leiteten wir 30% des Datenverkehrs auf o3-mini um. Am Ende haben wir nicht nur den gesamten Verkaufsförderungsaktionen standhalten können, sondern die Kosten waren auch deutlich niedriger als erwartet.
Zuerst müssen wir herausfinden, was o3-mini eigentlich ist.
Es handelt sich um das leichtgewichtige Inferenzmodell, das OpenAI im Jahr 2026 unter dem Namen Q1 veröffentlicht hat. Es zeichnet sich besonders durch die Erstellung strukturierter Inhalte sowie die Ausführung einfacher Inferenzaufgaben mit geringer Verzögerung aus. Die maximale Kontextfenstergröße beträgt 128 KB, und die Kosten pro Token sind nur ein Achtel der Kosten von GPT-4o.
Die drei realsten Vorteile, die wir bisher erzielt haben:

- Während des Black Friday wurden 1,2 Millionen Anfragen zur Erstellung von Produktbeschreibungen gestellt.Während des Black Friday wurden 1,2 Millionen Anfragen zur Generierung von Produktbeschreibungen gestellt. Die Gesamtrechenkosten sind im Vergleich zur vorherigen Nutzung von GPT-4o um 62 % gesunken.Der Gesamtrechenkosten sind im Vergleich zuvor mit GPT-4o um 62% gesunken. Es wurde nicht ein einziges Mal ein Limit ausgelöst – selbst die Spitzenanfragen eine Stunde vor Beginn des Angebots wurden vollständig bearbeitet.
- Die meisten Anfragen erhalten ihre Ergebnisse innerhalb von 18 Millisekunden zurück. Früher gab es bei der Verwendung großer Modelle gelegentlich Verzögerungen von mehreren hundert Millisekunden. Wir haben die Anzeige, die auf die Ladezeit der Inhalte auf unserer Frontend-Seite hinweist, entfernt, und dadurch ist die Konversionsrate der Nutzer um 0,8 Prozentpunkte gestiegen.
- Die integrierte Mehrsprachengenerierungsfunktion erfordert keine zusätzlichen Anpassungen von unserer Seite. Die Genauigkeit der auf den lateinamerikanischen Websites veröffentlichten Beschreibungen auf Portugiesisch und Spanisch hat sich um 21% verbessert im Vergleich zu den zuvor selbst feinabgestimmten kleineren Modellen. Dadurch entfällt die Notwendigkeit, dass das Operativteam Zeit für eine erneute Korrektur aufwendet.
Keine Sorge – mit dem vollständigen Umstieg sollten Sie nicht sofort beginnen; wir haben bereits auf einige Probleme gestoßen, die Sie vermeiden können.

Verwenden Sie es nicht für komplexe logische Schlussfolgerungen bei der Produktempfehlung. Zuerst haben wir versucht, die Benutzer-Browsereihenfolgen einzugeben, um personalisierte Empfehlungstexte zu generieren, aber dreimal von zehn Fällen gab es Fehler in der Korrelation – zum Beispiel wurden Empfehlungen für Outdoor-Zelte unter Campinglampen angezeigt. Am Ende haben wir diesen Teil wieder an das große Modell übergeben.
Und wenn Ihre Geschäftsprozesse die Nutzung von Tools erfordern, unterstützt das System derzeit nur die parallele Ausführung von maximal drei Tools. Bei mehr als drei Tools kann es entweder zu Ausführungsfehlern kommen oder zu fehlerhaften Rückgabewerten der Parameter. Bei unseren Lagerbestandsabfragen sind bereits mehrfach Probleme aufgetreten, bei denen die angezeigten Preise ungenau waren, wenn mehr als zwei Tools verwendet wurden. Dies wurde nun behoben, indem die Systeme bei mehr als zwei Tools-Aufrufen automatisch auf ein allgemeines Großmodell umgeleitet werden.
Wer es für geeignet hält, der sollte es nutzen – wer es nicht für geeignet hält, der sollte es besser nicht anfassen.
Wenn Ihre Geschäftsszenarien die massenhafte Erstellung strukturierter Inhalte, die einfache Erkennung von Benutzungszwecken oder die Beantwortung häufig gestellter Fragen (FAQs) umfassen – insbesondere wenn kleine und mittlere Unternehmen nicht über die zusätzliche Rechenleistung verfügen, um kleine Modelle selbst anzupassen – dann ist o3-mini definitiv die wirtschaftlich beste Wahl.
Aber wenn Sie komplexe Code-Debugging-Aufgaben durchführen, mehrstufige logische Schlussfolgerungen ziehen oder lange Dokumente detailliert analysieren müssen, ist es besser, auf allgemeine Großmodelle zurückzugreifen. In diesen Fällen wird die Genauigkeit der Ausgabe von o3-mini deutlich geringer sein, und Sie werden mehr Zeit mit der Überprüfung der Ergebnisse verbringen müssen.
Zwei praktische Tipps für diejenigen, die es zum ersten Mal verwenden:

Zuerst führen Sie eine 7-tägige Grauzonen-Phase für den Datenverkehr durch, ohne alles auf einmal umzustellen. Am Anfang haben wir zuerst die Szenarien mit nicht-kernrelevanten Produkttags generiert und diese 3 Tage lang getestet, um sicherzustellen, dass die Fehlerrate im akzeptablen Bereich liegt. Erst danach haben wir schrittweise auf die Szenarien mit den Kerninhalten der Produktdescriptions umgestellt, um Probleme zu vermeiden, die den Online-Betrieb beeinträchtigen könnten.
Man kann selbst eine einfache Routing-Schicht aufbauen, die Anfragen nach ihrer Komplexität klassifiziert: Einfache Anfragen werden über o3-mini geleitet, während komplexe Anfragen automatisch an das große Modell weitergeleitet werden. Dadurch können Kosten eingespart werden, ohne dass die Leistung in komplexen Szenarien beeinträchtigt wird. Genau das machen wir auch jetzt – 90 % der Anfragen werden über o3-mini abgewickelt, und die verbleibenden 10 % komplexen Anfragen werden an das große Modell weitergeleitet. Dadurch sind die Gesamtkosten um mehr als die Hälfte gesunken.
Häufige Kleinprobleme
Frage: Sollte o3-mini feinjustiert werden? Antwort: Wenn es sich um die Generierung allgemeiner Inhalte handelt, ist das überhaupt nicht notwendig – die native Leistung reicht bereits aus. Wenn es jedoch um Szenarien mit vielen branchenspezifischen Begriffen geht, kann man einige hundert Beispiele zur Feinjustierung verwenden. Nach der Feinjustierung unserer Beschreibungen für Autoteile stieg die Genauigkeit um 14%, während die Kosten nur um 5% erhöht wurden.
Frage: Ist die Datensicherheit gewährleistet? Antwort: Standardmäßig werden keine Benutzereingaben verwendet, um Modelle zu trainieren. Falls Sie Compliance-Anforderungen haben, können Sie eine dedizierte Instanz auswählen, was 30% mehr Kosten bedeutet. Die Daten werden jedoch vollständig isoliert, was besonders geeignet ist für die Verarbeitung von Inhalten, die die Privatsphäre der Nutzer betreffen.
Artikellink:https://airai.cc/de/ai-news/37/
War das hilfreich?