Menü

Unser Team hat die Adresserkennung auf GPT-5 umgestellt, wodurch die Fehlerrate von 429 von 13% auf 0,2% gesunken ist. Allerdings sind wir auf zwei unerwartete Probleme gestoßen.

Der große Black Friday-Rabattaktionen-Monat ist gerade erst vorbei, und unsere drei Backend-Entwickler haben die Überwachungspaneele ganze 72 Stunden lang nicht aus den Augen gelassen. Letztes Jahr gab es während der Rabattaktionen ein großes Problem: 13 Prozent der Adressauflösungsanfragen wurden direkt mit einer 429-Fehlermeldung abgewiesen. Dieses Jahr ist das Problem endlich nicht mehr aufgetreten. Die einzige wesentliche Anpassung war, dass wir das bisher verwendete allgemeine Großmodell durch GPT-5 ersetzt haben, um die Adressstrukturierung zu optimieren.

Für diejenigen, die es noch nicht ausprobiert haben: Was genau ist GPT-5 für Szenarien wie unsere?

Es handelt sich um das von OpenAI in diesem Jahr aktualisierte multimodale Großmodell, und der für uns am nützlichste Parameter-Ankerpunkt ist nur einer:Die maximale Anzahl strukturierter Anfragen, die pro Minute von einem einzelnen Konto verarbeitet werden können, ist das 12-fache im Vergleich zum vorherigen Modell.Und die Erkennungsgenauigkeit für nicht standardmäßige Eingaben hat sich direkt um ein Vielfaches verbessert.

Wir betreiben grenzüberschreitende Logistik in Europa und verarbeiten täglich 500.000 Adressen, die von Nutzern eingegeben werden. Viele Menschen verwechseln Straßen, Postleitzahlen und Städte, fügen sogar Emojis hinzu oder schreiben die Adressen nur teilweise falsch. Die früheren Modelle erkannten die Adressen entweder falsch oder es waren drei Anfragen an die APIs erforderlich, um ein Ergebnis zu erhalten. Bei starkem Verkehr während von Rabattaktionen kommt es direkt zu Beschränkungen in der Leistungsfähigkeit des Systems.

Nach dem Wechsel zu GPT-5 haben wir tatsächlich drei Vorteile erzielt.

Der erste und offensichtlichste Aspekt: Das Problem der Bandbreitendrosselung wird direkt gelöst.Während des Höhepunkts der Großverkaufsförderung sank die Fehlerrate von 429 auf 0,2%.Wir müssen nicht einmal eine Reserve-Modell-Warteschlange einsetzen, was 30% der zuvor für die Lastverteilung aufgewendeten Wartungszeit einspart.

Zweitens hat sich die Genauigkeit der Adresserkennung verbessert. Früher mussten etwa 8 Prozent der Adressen manuell nachgeprüft werden, jetzt ist dieser Anteil auf unter 1 Prozent gefallen. Dadurch muss das Kundenservice-Team wöchentlich etwa 2000 Adresskorrekturanfragen weniger bearbeiten.

Der dritte Punkt wurde hingegen von nicht vielen Menschen erwähnt: Er unterstützt das Direktaufladen von Fotos von handschriftlichen Bestellformularen zur Erkennung, sodass wir keinen separaten OCR-Dienst mehr in Anspruch nehmen müssen, um die Texte zu extrahieren. Dadurch wird der Prozess um zwei Schritte vereinfacht, und die Ergebnisse werden in der Regel innerhalb von 15 Millisekunden zurückgegeben. Nur bei sehr verschwommenen Bildern kann die Ausführung etwas länger dauern.

Schaut nicht nur auf die Vorteile – die beiden Fallstricke, in die wir geraten sind, werdet ihr mit großer Wahrscheinlichkeit auch selbst erleben.

Detailed view of programming code in a dark theme on a computer screen.

Das erste Problem ist die mangelnde Anpassung an die Dialekt-Schreibweisen in Regionen mit kleinen Sprachen. Wir dachten, die Multilingual-Fähigkeiten wären ausreichend, aber letzte Woche stieg die Fehlerrate bei der Erkennung von baskischen Adressen in Spanien plötzlich auf 12%. Nach Untersuchung stellten wir fest, dass es nur sehr wenige Adressbeispiele für solche seltenen Dialekte in den Trainingsdaten gibt. Jetzt können wir diesen Adressen nur lokale Regeln hinzufügen, um das Problem zu umgehen.

Der zweite Haken ist der Kostenaspekt. Zuvor haben wir berechnet, dass die Kosten für einen einzelnen Request-Token nur um 20 Prozent höher sind als bei der vorherigen Generation. Allerdings haben wir vergessen, dass die standardmäßig zurückgegebenen strukturierten Felder um drei mehr sind als zuvor, was zu einer tatsächlichen Steigerung der Token-Kosten um 40 Prozent führt. Später haben wir die zurückgegebenen Felder im Prompt auf die fünf erforderlichen Felder beschränkt, wodurch die Kosten wieder auf ein Niveau von 10 Prozent über dem der vorherigen Generation gesenkt werden konnten.

Welche Teams sollten direkt loslegen, und welche sollten überhaupt nicht daran teilnehmen?

  • Es werden täglich mehr als 100.000 Anfragen für die strukturierte Verarbeitung von nicht standardisiertem Text und Bildmaterial benötigt. Für Teams, die bereits aufgrund von Modell-Beschränkungen und unzureichender Genauigkeit in ihrer Arbeit eingeschränkt waren – beispielsweise kleine und mittlere Unternehmen, die im E-Commerce, in der Logistik oder im Kundenservice tätig sind – wird sich der Return on Investment (ROI) nach dem Wechsel zu diesem neuen System deutlich verbessern.
  • Was nicht verwendet werden sollte: Für einfache Fragen und Antworten, Inhaltsgenerierung oder Teams, deren Anfragenanzahl täglich unter 10.000 liegt, ist es völlig unnötig, dieses Geld auszugeben. Die vorherige Generation von Modellen reicht vollkommen aus und spart sogar viel Kosten.

Zwei konkrete Ratschläge für Anfänger

Zuerst sollten Sie mit den historischen, tatsächlichen Anfragen der letzten 7 Tage ein Testset erstellen. Verwenden Sie nicht nur die von den Behörden bereitgestellten Beispiele – insbesondere bei Inhalten, die sich auf kleine Sprachen oder weniger bekannte Regionen beziehen. Stellen Sie sicher, dass Sie die Systemleistung zuerst überprüfen, um die Genauigkeit zu überprüfen. Andernfalls könnte es nach der Veröffentlichung sehr problematisch werden, wenn Fehler festgestellt werden.

Zweitens: Bei der ersten Aufrufung sollten Sie die benötigten Rückgabefelder direkt im Prompt fest angeben, anstatt sie dem System freie Hand zu lassen. Andernfalls kann das zusätzlich generierte Inhalte zu unnötigen Token-Kosten führen.

Jemand fragt: Muss man sich jetzt noch für GPT-5 anstellen, um einen Antrag zu stellen?

Wir haben ein Entwicklerkonto für Unternehmen. Nachdem die erforderlichen Unterlagen eingereicht wurden, ist die Aktivierung des Kontos in 3 Tagen abgeschlossen. Für Einzelentwickler kann die Aktivierung jedoch 1 bis 2 Wochen dauern. Bei dringenden Bedürfnissen steht jedoch der „grüne Kanal“ für Unternehmen zur Verfügung, über den das Konto noch am selben Tag aktiviert werden kann.

War das hilfreich?

Technischer SupportLive-Support
侧栏
Nach oben
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR