Wir haben mit GPT-4o die Genauigkeit des multimodalen Kundenservice-Systems auf 92 % erhöht, aber diese drei Probleme haben uns wirklich viel Mühe gekostet.
Letzten Monat hat unser dreiköpfiges Technikteam für den E-Commerce-Handel in Südostasien drei Nächte durchgearbeitet, um das intelligente Kundenservice-System von einem alten Textmodell auf GPT-4o umzustellen. Ursprünglich dachten wir, es würde nur um die Hinzufügung einer Bilderkennungsfunktion gehen, aber die Veränderungen, die dies mit sich brachte, waren viel umfangreicher als erwartet, und wir sind auf viele unerwartete Probleme gestoßen.
Für diejenigen, die noch nicht damit in Berührung gekommen sind: Was genau ist GPT-4o?
Essenziell handelt es sich um ein multimodales Generationsmodell von OpenAI, und der wichtigste Unterschied zu seinen Vorgängern ist…Eine Runde kann gleichzeitig Text, Bilder und Audio-Eingaben verarbeiten, ohne dass es notwendig ist, die Anfragen zu trennen und unterschiedliche Modelle einzurufen.Die Eingabeverarbeitung muss nicht selbst durchgeführt werden, da die API-Parameter um fast 60% weniger sind als bei kombinierten Aufrufen.
Warum müssen wir es genau im Jahr 2026 ändern?
Bisher konnten unsere Kundenservice-Systeme nur Textanfragen bearbeiten. Wenn Kunden Fotos von beschädigten Produkten oder falsch gelieferten Waren machten, musste der Inhalt der Fotos erst manuell in eine textuelle Beschreibung umgewandelt werden, bevor er an das Modell weitergeleitet werden konnte. Während der großen Verkaufsaktionen verstopfte allein dieser Schritt fast 20 Prozent der Arbeitsaufträge, und die Kundenbeschwerden stiegen direkt um das Doppelte. Wir haben auch versucht, ein System zu verwenden, das Bilderkennungsmodelle mit Textmodellen kombiniert, aber die Genauigkeit lag nur bei 76%. Die Kosten für die Nachverkaufsanfragen, die auf Fehlurteilen beruhten, waren sogar höher als die Kosten für die Modelle selbst.
Die drei direktesten Vorteile übertreffen unsere ursprünglichen Erwartungen bei weitem.

- Die automatische Bearbeitungsrate der After-Sales-Work Orders ist direkt von 47 % auf 92 % gestiegen. Die beiden Teilzeit-Mitarbeiter, die ursprünglich für die Umwandlung von Bildern zuständig waren, wurden stattdessen für die Bearbeitung komplexerer Kundenbeschwerden eingesetzt. Dadurch wurden monatlich fast 1800 US-Dollar an Personalkosten eingespart.
- Die von den Nutzern gesendeten Dialekt-Sprachanfragen müssen nicht mehr über eine separate ASR-Schnittstelle geleitet werden; sie können direkt an das Modell übertragen werden, wo sie erkannt und mit einer Antwort versehen werden. Die meisten Anfragen werden innerhalb von 15 Millisekunden bearbeitet, was die Gesamtreaktionszeit um das Dreifache beschleunigt.
- Beim Bearbeiten derselben After-Sales-Anfrage mit Bildern und Texten wurde der Tokenverbrauch um 32% geringer als bei der getrennten Nutzung des Bilderkennungs- und Textmodells. Somit ist der Modellkostenaufwand während der Spitzenzeiten der Rabattaktion sogar niedriger als zuvor.
Schauen Sie nicht nur auf die Vorteile – diese 3 versteckten Fallstricke haben uns tatsächlich zu echten Verlusten geführt, als wir darauf gestoßen sind.
Das erste Problem war, dass die Throttling-Thresholds für multimodale Eingaben viel strenger waren als für rein textbasierte Anfragen. Am ersten Tag der Veröffentlichung trafen wir zufällig auf eine Geschäftsfestveranstaltung einer Website in Südostasien, bei der 17 Prozent der Anfragen mit Bildern direkt mit einer Fehlermeldung (429) abgewiesen wurden. Die Benutzer sahen keine Antwort und dachten, das Kundenservice-Team hätte aufgehört zu arbeiten, was zu über 300 negativen Bewertungen führte. Später mussten wir für Anfragen mit Bildern eine separate Warteschlange einrichten, die während der Spitzenzeiten zunächst die Meldung „Bild erhalten, wird verarbeitet“ zurückgibt, um das Problem zu lösen.
Das zweite Problem ist, dass die Erkennungsgenauigkeit für Bilder in nicht-englischen Sprachen bei der Texterkennung weitaus niedriger ist, als in der Werbung angegeben. Wir hatten den Fall, dass das Modell bei einer indonesischen handschriftlichen Lieferbescheinigung drei Adresszeichen falsch erkannt hat und dem Kunden daher die falsche Adresse für die Rücksendung oder Umtauschaktion zugewiesen hat, was zu Transportkosten in Höhe von fast 200 US-Dollar führte. Jetzt haben wir eine lokale OCR-Schnittstelle hinzugefügt, um die Erkennung von Bildern in nicht-englischen Sprachen zu überprüfen, und konnten so die Fehlerrate auf ein akzeptables Niveau senken.
Der dritte Fehler besteht darin, dass die Regeln für die Token-Zählung bei multimodalen Ausgaben völlig anders sind als bei reinem Text, wodurch es nicht möglich ist, die Kosten mit den vorherigen Formeln abzuschätzen. In der ersten Woche nach der Veröffentlichung haben wir die Warnschwellen für das Budget nicht geändert, und die Kosten für ein Wochenende überstiegen bereits 40 Prozent des monatlichen Budgets – erst als die Finanzabteilung uns daran erinnerte, haben wir es bemerkt.
Sollten wir es jetzt wirklich ändern? Wir haben klare Kriterien für die Entscheidung erstellt.
Fälle, in denen Sie direkt vorgehen können:

- Ihr Geschäft erfordert es, gleichzeitig mit zwei oder mehr Arten von Eingaben zu arbeiten – Text, Bildern und Audio.
- Zuvor wurden bereits mehrere Modelle kombiniert, um eine multimodale Verarbeitung durchzuführen. Allerdings waren die Integrationskosten hoch und die Genauigkeit nicht ausreichend.
- Deine Nutzer verwenden hauptsächlich Englisch, oder die gängigen Sprachen, für die GPT-4o eine relativ gute Unterstützung bietet.
Situationen, in denen es absolut nicht notwendig ist, Geld auszugeben:
- Ihr Geschäft benötigt nur die Verarbeitung reiner Texte, und die vorherige Modellgeneration konnte bereits die Anforderungen an die Genauigkeit erfüllen.
- Ihr Geschäft konzentriert sich hauptsächlich auf kleine Sprachmärkte und umfasst die Erkennung großer Mengen an lokalen, handgeschriebenen Texten sowie Dialektstimmen.
- Ihr Team verfügt nicht über zusätzliches Personal, um Entwicklungsarbeiten für Downgrade-Strategien oder die Überwachung von Kosten durchzuführen.
Zwei praktische Ratschläge für Teams, die gerade anfangen wollen
Zuerst sollten Sie 7 Tage lang einen „Shadow Traffic“-Testlauf durchführen, bevor Sie die Systeme live schalten. Wechseln Sie nicht sofort zu 100 % der Anfragen. Senden Sie die Anfragen der echten Nutzer sowohl an Ihr ursprüngliches System als auch an GPT-4o und vergleichen Sie die Genauigkeit sowie die Kosten beider Systeme. Erst wenn Sie sichergehen können, dass alles den Erwartungen entspricht, sollten Sie den Traffic schrittweise umleiten. Wir haben damals genau deshalb einen großen Fehler gemacht, weil wir diesen Schritt ausgelassen haben.
Zweitens sollte für mehrmodale Anfragen ein separates Budgetwarnsystem eingerichtet werden, wobei der Schwellenwert auf 120 % der geschätzten Kosten festgelegt werden kann, um Kostenüberschreitungen zu vermeiden.
Häufig gestellte Fragen und Antworten
Frage: Sollte man warten, bis das nächste Modell verfügbar ist, bevor man wechselt?
Antwort: Zumindest im Bereich der Multimodal-Integration ist die Reife von GPT-4o derzeit ausreichend, um tatsächliche Probleme zu lösen. Die nächste Generation des Modells wird voraussichtlich erst in mehr als einem Jahr verfügbar sein. Es macht daher keinen Sinn, die derzeit sparsamen Kosten für ungewisse Upgrades zu verschwenden.
Frage: Wie steht es hinsichtlich des Preis-Leistungs-Verhältnisses im Vergleich zu offenen, multimodalen Modellen?
Antwort: Wenn Ihr Team in der Lage ist, offene Modelle selbst anzupassen und zu deployen und die Anforderungen an Datenprivatsphäre hoch sind, dann sind offene Modelle wirtschaftlicher. Andernfalls ist die direkte Nutzung von GPT-4o kostengünstiger als der Aufbau und die Wartung eigener Server.
Artikellink:https://airai.cc/de/ai-news/30/
War das hilfreich?