我们用Claude 3把客户售后工单处理效率提了3倍,但踩了2个不该踩的坑
上周黑五结束拉报表时,我们东南亚电商SaaS团队的3个开发盯着后台数据愣了半天:往年要整个客服组连轴转3天才能处理完的售后工单,今年大半都自动处理完了,客户投诉量直接掉了42%。核心改动只有一个:把原来的工单语义识别逻辑全换成了Claude 3 Opus。
先给没接触过的人说句实在的
它是Anthropic在2024年推出的第三代大语言模型,我们实际用下来的核心参数锚点很简单:200k上下文窗口下,处理带3张商品截图的售后工单,准确率比之前用的同参数级模型高18%。
对我们这种小团队来说,三个收益是真金白银的

第一个是不用再单独搞多模态预处理。之前用户上传的破损商品图、物流截图,我们得先接一个OCR模型转文字,再和文字工单拼到一起喂给大模型,光这套链路的维护就占了一个后端半的精力。换Claude 3之后直接把图片和文字一起传,识别错漏的情况反而少了。
第二个是拒答率低到几乎可以忽略。之前的模型碰到用户写得太乱的工单(比如半英文半当地语言,还混着网络缩写),经常直接返回无法识别,得转人工。我们统计过,那段时间转人工的比例有27%,现在这个数字是4%。
第三个是调用成本比我们预想得低太多。我们按实际用量付费,黑五峰值那天日均处理1.2万张工单,总花费不到800美元,比雇10个临时客服的成本省了90%。
但别着急冲,我们踩的两个坑足够让你白忙活一周
第一个坑是多语言对齐的问题。我们的用户有一半用印尼语,一开始没做微调就直接上线,结果碰到当地特有俚语的时候,模型经常把“商品发错颜色”识别成“用户要更换收货地址”,一周出了17个客诉。后来我们喂了3000条标注过的当地语工单微调,问题才解决。
第二个坑是长上下文下的信息遗漏。如果工单里附了5张以上的图片,模型偶尔会漏掉中间某张的信息,比如用户拍了包装破损和商品破损两张图,它只识别到包装的问题。我们后来加了个简单的校验规则:如果图片超过3张,就让模型先逐张输出识别结果,再汇总处理,就没再出过错。
说句实在的,不是所有团队都适合用

你该用的情况:

- 你的业务需要同时处理文字和图片/短音频,不想搭多套模型链路
- 你对输出准确率要求很高,比如处理工单、合同审核这类出错成本高的场景
- 你的团队人力不足,没精力维护复杂的模型预处理链路
你别浪费钱的情况:
- 你只是要做简单的关键词回复、生成营销文案这类轻量任务,用便宜的小模型足够
- 你的业务数据有严格的本地化存储要求,没法把数据传到第三方模型接口
- 你的请求量特别小,每月不到1000次,换模型的开发成本比收益还高
给第一次上手的人两个实操建议
第一个是先从边缘场景测7天再上核心链路。我们一开始先拿过去3个月的历史工单跑离线测试,准确率到95%以上才切了10%的线上流量,慢慢涨到全量,没出过大的线上事故。
第二个是不用一开始就选最贵的Opus版本。我们测过,处理普通不带图片的咨询工单,Sonnet版本的准确率和Opus差不到2%,成本只有一半,足够用。
最后说个大家常问的问题:要不要等下一代模型?我们的答案是,如果你现在的业务已经被多模态处理、准确率不够的问题卡着效率,现在用就刚好,毕竟早用早省下来的人力成本,比等下一代模型降的那点调用费高多了。
有用吗?