我們用Claude 3把客戶售後工單處理效率提了3倍,但踩了2個不該踩的坑
上周黑五結束拉報表時,我們東南亞電商SaaS團隊的3個開發盯著後台數據愣了半天:往年要整個客服組連軸轉3天才能處理完的售後工單,今年大半都自動處理完了,客戶投訴量直接掉了42%。核心改動只有一個:把原來的工單語義識別邏輯全換成了Claude 3 Opus。
先給沒接觸過的人說句實在的
它是Anthropic在2024年推出的第三代大語言模型,我們實際用下來的核心參數錨點很簡單:200k上下文窗口下,處理帶3張商品截圖的售後工單,準確率比之前用的同參數級模型高18%。
對我們這種小團隊來說,三個收益是真金白銀的

第一個是不用再單獨搞多模態預處理。之前用戶上傳的破損商品圖、物流截圖,我們得先接一個OCR模型轉文字,再和文字工單拼到一起餵給大模型,光這套鏈路的維護就佔了一個後端半的精力。換Claude 3之後直接把圖片和文字一起傳,識別錯漏的情況反而少了。
第二個是拒答率低到幾乎可以忽略。之前的模型碰到用戶寫得太亂的工單(比如半英文半當地語言,還混著網絡縮寫),經常直接返回無法識別,得轉人工。我們統計過,那段時間轉人工的比例有27%,現在這個數字是4%。
第三個是調用成本比我們預想得低太多。我們按實際用量付費,黑五峰值那天日均處理1.2萬張工單,總花費不到800美元,比雇10個臨時客服的成本省了90%。
但別著急衝,我們踩的兩個坑足夠讓你白忙活一周
第一個坑是多語言對齊的問題。我們的用戶有一半用印尼語,一開始沒做微調就直接上線,結果碰到當地特有俚語的時候,模型經常把「商品發錯顏色」識別成「用戶要更換收貨地址」,一周出了17個客訴。後來我們餵了3000條標注過的當地語工單微調,問題才解決。
第二個坑是長上下文下的信息遺漏。如果工單里附了5張以上的圖片,模型偶爾會漏掉中間某張的信息,比如用戶拍了包裝破損和商品破損兩張圖,它只識別到包裝的問題。我們後來加了個簡單的校驗規則:如果圖片超過3張,就讓模型先逐張輸出識別結果,再匯總處理,就沒再出過錯。
說句實在的,不是所有團隊都適合用

你該用的情況:

- 你的業務需要同時處理文字和圖片/短音頻,不想搭多套模型鏈路
- 你對輸出準確率要求很高,比如處理工單、合同審核這類出錯成本高的場景
- 你的團隊人力不足,沒精力維護複雜的模型預處理鏈路
你別浪費錢的情況:
- 你只是要做簡單的關鍵詞回復、生成營銷文案這類輕量任務,用便宜的小模型足夠
- 你的業務數據有嚴格的本地化存儲要求,沒法把數據傳到第三方模型接口
- 你的請求量特別小,每月不到1000次,換模型的開發成本比收益還高
給第一次上手的人兩個實操建議
第一個是先從邊緣場景測7天再上核心鏈路。我們一開始先拿過去3個月的歷史工單跑離線測試,準確率到95%以上才切了10%的線上流量,慢慢漲到全量,沒出過大的線上事故。
第二個是不用一開始就選最貴的Opus版本。我們測過,處理普通不帶圖片的咨詢工單,Sonnet版本的準確率和Opus差不到2%,成本只有一半,足夠用。
最後說個大家常問的問題:要不要等下一代模型?我們的答案是,如果你現在的業務已經被多模態處理、準確率不夠的問題卡著效率,現在用就剛好,畢竟早用早省下來的人力成本,比等下一代模型降的那點調用費高多了。
有用嗎?