Ein südostasiatischer Lebensmittel-E-Commerce-Anbieter nutzt Claude für die Qualitätsprüfung von Bestellungen und spart dadurch drei Kundenservice-Stellen – doch dabei stößt er auf zwei tödliche Fallstricke.
Letzte Woche musste unser Team mit einem unerwarteten Problem umgehen: Am Tag der großen Rabattaktion blieben 18% der After-Sales-Anfragen aufgrund eines Fehlers in der Ausgabeformate von Claude im Warteschlangenstatus stecken. Dadurch verzögerte sich die Bearbeitung der Anfragen bezüglich der Entschädigung für beschädigte Frischprodukte um 4 Stunden, und die Rücksendungsrate stieg an diesem Tag um 2 Prozentpunkte.
Für diejenigen, die noch nichts davon wissen: Was genau ist Claude?
Es ist ein großes Sprachmodell, das von Anthropic entwickelt wurde. Die aktuellste Version 3.5 Sonnet verfügt über ein Einzelausgangsfenster, das 200.000 Token aufnehmen kann – das entspricht etwa 150.000 chinesischen Wörtern. Wir haben uns ursprünglich für dieses Modell entschieden, weil es möglich ist, den vollständigen Bestellverlauf, die OCR-Ergebnisse der Benutzerbelege sowie die Entschädigungsregeln der Plattform auf einmal einzuspeisen, ohne sie in mehrere Anfragen aufteilen zu müssen.
Die drei tatsächlichen Vorteile, die wir daraus erzielt haben

Am direktesten ist der Rückgang der Personalkosten: Von den ursprünglich sechs Kundendienstmitarbeitern, die für die Qualitätskontrolle von Bestellungen zuständig waren, müssen jetzt nur noch drei bleiben, um außergewöhnliche Fälle zu bewältigen. Allein die monatlichen Personalausgaben werden dadurch um 4200 US-Dollar eingespart.
Der zweite Punkt betrifft die Verbesserung der Verarbeitungsgeschwindigkeit: Früher dauerte die manuelle Überprüfung eines Vorgangs durchschnittlich 2 Minuten, jetzt werden die meisten Anfragen innerhalb von 15 Millisekunden abgewickelt. Nachdem die Nutzer ihre Entschädigungsanträge eingereicht haben, erhalten sie die Ergebnisse in der Regel innerhalb von 5 Sekunden. Unsere interne Statistik zeigt, dass die Zufriedenheit der Nutzer direkt um 17 Prozent gestiegen ist.
Der dritte Punkt ist die einheitlichere Ausführung der Regeln: Früher kam es bei der manuellen Überprüfung häufig zu derselben Art von Fehlern – manche Personen erhielten die volle Entschädigung, andere nur 30%. Jeden Monat gab es Dutzende Beschwerden von Nutzern wegen ungerechter Entscheidungen. Nachdem die Regeln mit Claude einheitlich gesteuert werden, sind solche Beschwerden auf weniger als drei pro Monat zurückgegangen.
Schauen Sie nicht nur auf die Vorteile – wegen diesen beiden Fehlern hätten wir fast den Dienst einstellen müssen.
Der erste Fehler war das Problem mit der Ratebegrenzung: Anfangs haben wir direkt mit der offiziellen API gearbeitet, ohne mehrere Ebenen der Fehlerbehandlung einzurichten. Am Tag der großen Rabattaktion verdreifachte sich die Anzahl der Anfragen, und die offizielle API gab direkt eine Fehlermeldung (429) zurück. Da wir keinen manuellen Ersatzmechanismus eingerichtet hatten, blieben Tausende von Tickets unbearbeitet. Später fügten wir ein kleineres Modell mit ähnlicher Funktionalität als Notfalllösung hinzu – sobald drei Anfragen in Folge fehlschlugen, wechselte der Systemverlauf automatisch zu diesem kleinen Modell, und erst bei weiteren Fehlschlägen wurde der Mensch eingeschaltet. Seitdem gab es keine mehrfachen Blockaden von Tickets mehr.
Der zweite Problempunkt ist die Instabilität der strukturierten Ausgabe: Anfangs forderten wir, dass die Ergebnisse in JSON-Format zurückgegeben werden. In etwa 2 Prozent der Fälle fügte die Systeme eine Menge erklärender Texte zum JSON hinzu, was dazu führte, dass unsere Parsing-Skripte direkt Fehler meldeten. Später fügten wir am Ende der Anweisung den Satz hinzu: „Wenn Ihre Ausgabe nicht rein in JSON ist, werden Sie geschlossen.“ Dadurch sank die Häufigkeit dieses Problems auf unter 0,1 Prozent.
Wer ist dafür geeignet? Und wer sollte es auf keinen Fall benutzen?

Wenn Ihr Team häufig mit einer großen Menge an wiederholenden Aufgaben zu kämpfen hat, bei denen die Regeln klar definiert sind und die Menge des zu verarbeitenden Textes nicht gering ist – beispielsweise bei der Überprüfung von E-Commerce-Aufträgen, der Klassifizierung von Kundendienstanfragen oder der ersten Prüfung von Vertragsbedingungen – und bereit ist, 1-2 Wochen in die Anpassung von Anweisungen („Prompts“) und die Entwicklung von Abstufungsmechanismen zu investieren, kann Claude Ihnen viel Geld und Zeit sparen.
Wenn Ihre Anwendung eine 100-prozentige Genauigkeit der Ergebnisse erfordert – beispielsweise in der medizinischen Diagnose, bei der endgültigen Überprüfung von Finanztransaktionen – oder wenn Ihr Team weder spezialisierte Betriebs- noch Entwicklungsmitarbeiter hat und Sie die Lösung sofort ohne jegliche Anpassungen einsetzen möchten, dann sollten Sie es besser lassen. Die Wahrscheinlichkeit, dass Probleme auftreten, ist viel höher, als Sie vielleicht denken.
Zwei praktische Tipps für diejenigen, die es zum ersten Mal verwenden
Zuerst sollten Sie nicht direkt in den Produktivbetrieb wechseln, sondern zunächst 7 Tage im Shadow-Modus arbeiten: Alle Anfragen werden sowohl von menschlichen Mitarbeitern als auch von Claude bearbeitet. Vergleichen Sie die Ergebnisse beider Methoden, um die Übereinstimmung zu überprüfen. Wechseln Sie den Datenverkehr erst, wenn die Übereinstimmung auf über 95 % steigt. Wir haben damals 10 Tage im Shadow-Modus gearbeitet und dabei drei Fälle festgestellt, in denen die Regelverständnisse abwichen. Wir haben die entsprechenden Prompts rechtzeitig angepasst, um Probleme zu vermeiden.
Zweitens: Versuchen Sie nicht, alle Anfragen an die leistungsstärkste Version zu senden. Nutzen Sie Haiku, wenn es für die jeweilige Anwendung geeignet ist – ansonsten verzichten Sie auf Sonnet. Später haben wir die einfachen Ticket-Anfragen auf Haiku umgeleitet, wodurch die Token-Kosten um 60 % gesunken sind und die Geschwindigkeit sogar verdoppelt wurde, ohne dass die Leistung beeinträchtigt wurde.
Häufig gestellte Fragen
- Gibt es das Problem eines Datenlecks?Wenn Ihre Daten sensibel sind, kaufen Sie einfach die Enterprise-Version und unterzeichnen Sie einen Datenverarbeitungsvertrag. Anthropic verwendet die Daten der Enterprise-Version nicht zur Modellentwicklung. Wir haben die Enterprise-Version 8 Monate lang genutzt und es gab keine Probleme mit den Daten.
- Wer ist besser als GPT?Wenn Ihre Anwendung lange Texte verarbeiten muss und ein hohes Verständnis des Kontextes erfordert, wählen Sie Claude; wenn Sie jedoch multimodale Funktionen wie das Zeichnen von Bildern benötigen, wählen Sie GPT. Wir verwenden beide derzeit in unterschiedlichen Szenarien.
Artikellink:https://airai.cc/de/ai-news/40/
War das hilfreich?