Wir haben die Genauigkeit der Abstimmung von Logistikadressen mit OpenAI o1 auf das Maximum erhöht, stießen jedoch auf drei unerwartete Probleme.
Nachdem der Höhepunkt des letztlichen Black Fridays vorbei war, atmete unser europäisches Backend-Team aus drei Personen endlich auf: Letztes Jahr führten bei der großen Rabattaktion 13 Prozent der Adressauflösungsanfragen aufgrund der Beschränkungen des einzelnen Modells direkt zu einem 429-Fehler. In diesem Jahr ist es nicht nur zu keinen Beschränkungen gekommen, sondern auch die Fehlerrate bei der Adressabgleichung ist um 82 Prozent gesunken. Der wesentliche Unterschied besteht darin, dass wir das Hauptrechenmodell auf „o1“ umgestellt haben.
Für diejenigen, die damit noch nicht in Berührung gekommen sind: Was genau ist o1?
Es handelt sich um das von OpenAI entwickelte, auf Inferenz und Verstärkung basierende Großmodell. Im Gegensatz zu GPT-4o verbringt dieses Modell mehr Zeit mit der Bearbeitung komplexer logischer Probleme. Die inoffiziellen Testergebnisse zur Grundinferenzfähigkeit liegen um ganze 87 Prozent über denen von GPT-4o – genau aus diesem Grund haben wir uns für dieses Modell entschieden.
Für kleine und mittelgroße Teams wie uns sind die Vorteile von o1 wirklich groß.
Der erste Vorteil löst direkt unser größtes Problem mit der Adressverarbeitung – das Passen der Adressen. Früher, als wir GPT-4o verwendet haben, verwechselten wir häufig gleichnamige Straßen in verschiedenen europäischen Ländern sowie gleichnamige Postleitzahlen. Insbesondere bei Adressen mit Rechtschreibfehlern mussten wir drei Ebenen von Regeln anwenden, um eine Genauigkeit von etwa 92% zu erreichen. Jetzt hat o1 diese Genauigkeit auf 98,7% erhöht – und den ganzen Code für diese Regeln haben wir letzte Woche bereits gelöscht.
Der zweite Punkt ist, dass man sich keine komplexen Prompt-Entwicklungsarbeiten mehr machen muss. Früher musste man fast 2000 Worte für die Prompt-Generierung verwenden, um sicherzustellen, dass die Modelle Ausgaben in unserem Backend-Format liefern. Zudem kam es häufig zu Fehlern in der Ausgabeformatierung. Jetzt genügt eine einzige Anweisung, und die Wartungskosten für die Prompt-Generierung sind auf null gefallen.
Der dritte Punkt ist, dass die Stabilität der parallelen Anfragen besser ist, als erwartet. Wir hatten ursprünglich Bedenken, dass die lange Rechenzeit zu Wartezeiten führen könnte, aber die Überwachung zeigt, dass die meisten Anfragen innerhalb von 15 Millisekunden abgeschlossen werden. Nur sehr wenige, besonders komplexe Anfragen nach Adressen in verschiedenen Ländern, dauern länger als 200 Millisekunden – was vollkommen im Rahmen unserer Akzeptanz liegt.
Aber seine Fallstricke können dich wirklich völlig unvorbereitet treffen.

Das erste Problem ist, dass der Tokenverbrauch viel höher ist als bei GPT-4o. In den ersten drei Tagen, nachdem wir den Wechsel vorgenommen haben, stieg die Rechenkosten direkt um das 2,3-fache. Später stellten wir fest, dass o1 seinen eigenen Denkprozess ebenfalls zum Tokenverbrauch zählt. Wenn Sie die Rechenlogik von o1 nicht benötigen, müssen Sie unbedingt die Ausgabe dieses Denkprozesses in den Aufrufparametern deaktivieren. Nachdem wir dies getan haben, sanken die Kosten wieder auf das Niveau von vorher – auf das 1,2-fache – was vollkommen akzeptabel ist.
Der zweite Fehler besteht darin, dass die Methode nicht für einfache, häufig auftretende Anfragen geeignet ist. Zuerst haben wir aus Bequemlichkeit alle Adressabfragen an o1 weitergeleitet, aber dann stellten wir fest, dass bei Adressen, die keinerlei Rechtschreibfehler aufwiesen und im standardisierten Format waren, die Genauigkeit der Abfrageergebnisse mit o1 und mit GPT-4o keine Unterschiede machte – im Gegenteil: Es kostete sogar mehr Geld. Jetzt haben wir eine einfache Vorabprüfung hinzugefügt, so dass nur Anfragen, die nicht dem standardisierten Format entsprechen, an o1 weitergeleitet werden. Dadurch sind die Kosten um weitere 30 Prozent gesunken.
Der dritte Fehler besteht darin, dass die Unterstützung für Eingaben in nicht-lateinischen Sprachen wie Chinesisch und Arabisch noch nicht stabil genug ist. Wir haben einige Nutzer aus dem Nahen Osten, und bei Adressen, die auf Arabisch eingegeben werden, treten gelegentlich Fehler bei der Interpretation auf. Nachdem wir dieses Problem an OpenAI gemeldet haben, warten wir derzeit noch auf eine Korrektur. Bis dahin führen wir zusätzliche Überprüfungen mit lokalen Regeln durch.
Wer sollte o1 verwenden? Wer soll jetzt nichts anfassen?
Wenn Sie mit Aufgaben zu tun haben, die logisches Denken erfordern – wie das Abgleichen komplexer Regeln, die Überprüfung mehrerer Bedingungen oder die Erstellung einfacher Code – und Sie bereits aufgrund von Grenzen in der Genauigkeit mit GPT-4o gestoßen sind, dann ist der Wechsel zu o1 eine sehr sinnvolle Entscheidung. Die Investitionen im Vergleich zu den Ergebnissen werden sich als sehr vorteilhaft erweisen.
Aber wenn du einfache Textklassifizierung, Inhaltsgenerierung oder häufige Standardanfragen durchführst, dann ist es überhaupt nicht notwendig, o1 zu verwenden – das wäre reine Geldverschwendung. GPT-4o oder sogar GPT-3.5 reichen völlig aus.
Zwei Tipps für Anfänger
- Zuerst verwenden wir die 1000 historischen Daten, die Sie zuvor mit dem alten Modell verarbeitet haben, für den Test. Führen Sie keinen vollständigen Wechsel durch, sondern überprüfen Sie schnell, ob die Steigerung der Genauigkeit die erhöhten Kosten ausgleichen kann. Wir haben das innerhalb von 2 Tagen getestet und beschlossen, das Modell zu wechseln.
- Beim Aufruf wird zunächst die Version o1-mini bevorzugt. Für 90 Prozent der kleinen und mittleren Teams reicht die Funktionalität von o1-mini vollkommen aus, und der Preis ist zudem um 60 Prozent günstiger als bei der Vollversion o1.
Zum Schluss noch eine der häufigsten Fragen: Wird o1 bald durch andere Modelle ersetzt? Zumindest in unserem Bereich der Adressanalyse haben wir alle derzeit auf dem Markt verfügbaren推理-Modelle getestet – keines erreicht eine höhere Genauigkeit als o1. Zumindest in den nächsten sechs Monaten wird o1 weiterhin unsere erste Wahl bleiben.
Artikellink:https://airai.cc/de/ai-news/35/
War das hilfreich?