Wir haben die Effizienz der Bearbeitung von Kundendienstanfragen mit Claude 3 um das Dreifache gesteigert, aber dabei zwei Fehler gemacht, die wir nicht hätten machen dürfen.
Als wir letzte Woche am Black Friday die Berichte erstellten, waren drei Entwickler aus unserem SaaS-Team für den E-Commerce-Markt in Südostasien völlig verblüfft über die Daten aus dem Backend: Während in den vergangenen Jahren die gesamte Kundenservice-Abteilung drei Tage lang durchgearbeitet haben musste, um alle After-Sales-Anfragen zu bearbeiten, wurden in diesem Jahr die meisten davon automatisch gelöst. Die Anzahl der Kundenbeschwerden ist dadurch um 42 Prozent gesunken. Der einzige wesentliche Änderung war die Umstellung der ursprünglichen Logik zur semantischen Erkennung der Anfragen auf Claude 3 Opus.
Ehrlich gesagt, für diejenigen, die damit noch keine Erfahrung haben:
Es ist die dritte Generation des großen Sprachmodells, die Anthropic im Jahr 2024 veröffentlicht hat. Die Kernparameter, die wir tatsächlich verwendet haben, sind sehr einfach: Bei einem Kontextfenster von etwa 200.000 Einheiten werden After-Sales-Tickets mit drei Produktbildern verarbeitet, und die Genauigkeit liegt um 18% höher als bei den vorherigen Modellen mit ähnlichen Parametern.
Für eine kleine Team wie uns sind die drei Vorteile wirklich wertvoll und haben direkte finanzielle Auswirkungen.

Der erste Punkt ist, dass man keine separate Mehrmodalmusterung mehr durchführen muss. Früher mussten wir beschädigte Produktbilder und Logistik-Ausschnitte, die von den Nutzern hochgeladen wurden, zunächst mit einem OCR-Modell in Text umwandeln und diesen Text dann mit den Textanfragen zusammengeben, um ihn in das Großmodell einzuspeisen. Allein die Wartung dieser Prozesskette beanspruchte bereits die Hälfte der Ressourcen des Backends. Seit dem Einsatz von Claude 3 werden Bilder und Text direkt zusammen übertragen, wodurch die Anzahl der Fälle von Fehlern bei der Erkennung reduziert wurde.
Der zweite Punkt ist, dass die Rate der Ablehnungen so niedrig ist, dass sie fast vernachlässigbar ist. Frühere Modelle konnten bei Tickets, die von Nutzern in einer sehr unklaren Schreibweise verfasst wurden – beispielsweise halb auf Englisch, halb in der lokalen Sprache, zusammen mit Internetabkürzungen – oft nicht erkennen, was dazu führte, dass die Tickets manuell bearbeitet werden mussten. Wir haben festgestellt, dass der Anteil der manuell bearbeiteten Tickets in dieser Zeit 27 Prozent betrug; jetzt liegt dieser Wert bei 4 Prozent.
Der dritte Punkt ist, dass die Anrufkosten viel niedriger sind, als wir erwartet hatten. Wir zahlen nach tatsächlicher Nutzung, und am Höhepunkt des Black Friday wurden täglich durchschnittlich 12.000 Tickets bearbeitet – die Gesamtkosten lagen unter 800 US-Dollar, was 90 Prozent der Kosten für die Anstellung von 10 temporären Kundendienstmitarbeitern ausmacht.
Aber beeil dich nicht, wir sind in zwei Fallen geraten, die ausreichen, um dich eine ganze Woche lang arbeitslos zu machen.
Das erste Problem war das Problem der Mehrsprachenausrichtung. Die Hälfte unserer Nutzer spricht Indonesisch, und wir haben das System ohne weitere Anpassungen direkt online gestellt. Als es auf lokale Slangausdrücke stieß, interpretierte das Modell oft Aussagen wie „Das Produkt wurde in der falschen Farbe versendet“ als „Der Kunde möchte die Lieferadresse ändern“, was zu 17 Kundenbeschwerden innerhalb einer Woche führte. Erst nachdem wir 3000 annotierte lokale Tickets zum Trainieren des Modells hinzugefügt hatten, konnte das Problem gelöst werden.
Der zweite Fehler besteht in der Verlust von Informationen im Zusammenhang mit längeren Kontexten. Wenn mehr als 5 Bilder zu einem Ticket hinzugefügt werden, kann es vorkommen, dass das Modell Informationen eines bestimmten Bildes übersehen wird. Zum Beispiel, wenn der Benutzer Bilder von beschädigter Verpackung und beschädigtem Produkt anfügt, erkennt das Modell möglicherweise nur das Problem mit der Verpackung. Später haben wir eine einfache Überprüfungsregel hinzugefügt: Wenn es mehr als 3 Bilder gibt, lässt das Modell die Erkennungsergebnisse für jedes Bild nacheinander ausgeben und erst danach zusammenfassend verarbeitet, was seitdem zu keinen Fehlern mehr geführt hat.
Ehrlich gesagt, eignen sich nicht alle Teams für die Nutzung davon.

Sie sollten dies verwenden, wenn...

- Ihr Geschäft benötigt die gleichzeitige Verarbeitung von Texten sowie Bildern/Kurzaudiodaten und Sie möchten keine zusätzlichen Modelle einsetzen.
- Du hast sehr hohe Anforderungen an die Genauigkeit der Ausgabe – beispielsweise bei der Bearbeitung von Worktickets oder der Überprüfung von Verträgen, in denen Fehlern hohe Kosten entstehen können.
- Ihr Team verfügt über nicht genügend Personal und hat keine Ressourcen, um die komplexen Vorverarbeitungsschritte für die Modelle aufrechtzuerhalten.
Situationen, in denen du dein Geld nicht verschwenden solltest:
- Sie müssen nur einfache Antworten auf Schlüsselwörter geben oder Marketingtexte erstellen – für solche leichten Aufgaben reichen günstige kleine Modelle aus.
- Ihre Geschäftsdaten unterliegen strengen Anforderungen hinsichtlich der lokalen Speicherung, weshalb es nicht möglich ist, die Daten an Drittanbieter-Modell-APIs weiterzuleiten.
- Deine Anfragenzahl ist besonders niedrig – weniger als 1000 pro Monat – und die Entwicklungskosten für ein neues Modell übersteigen die erzielten Einnahmen.
Zwei praktische Ratschläge für Anfänger
Zuerst wurden die Randfälle über 7 Tage lang getestet, bevor die Lösung in die Kernsysteme integriert wurde. Zu Beginn haben wir die historischen Tickets der letzten 3 Monate genutzt, um Offline-Tests durchzuführen. Erst als die Genauigkeit über 95% lag, haben wir 10% des Online-Datenverkehrs auf die neue Lösung umgeleitet und diese schrittweise auf den gesamten Online-Datenverkehr ausgeweitet, ohne dass es zu größeren Problemen kam.
Der zweite Punkt ist, dass man nicht von Anfang an die teuerste Opus-Version wählen sollte. Wir haben festgestellt, dass bei der Bearbeitung gewöhnlicher Anfragen ohne Bilder die Genauigkeit der Sonnet-Version nur um etwa 2% geringer ist als die der Opus-Version – und der Kostenfaktor liegt dabei bei nur der Hälfte. Das reicht vollkommen aus.
Zum Schluss noch eine Frage, die viele Leute stellen: Soll man auf das nächste Modell warten? Unsere Antwort ist: Wenn Ihre aktuelle Geschäftslösung bereits durch Probleme mit der Multimodalverarbeitung und ungenügender Genauigkeit in ihrer Effizienz eingeschränkt wird, ist es genau jetzt der richtige Zeitpunkt, dieses Modell zu verwenden. Schließlich sparen Sie durch die frühe Anwendung viel Personalkosten – und diese Kosten übertrumpfen bei weitem die geringfügigen zusätzlichen Kosten für die Nutzung des nächsten Modells.
Artikellink:https://airai.cc/de/ai-news/41/
War das hilfreich?