菜单

我们把客服工单处理切到Claude 3.5 Sonnet,3个月省了2.1万欧元人力成本

上个月我们的欧洲电商客服团队差点崩盘:黑色星期五大促前一周,日均1200封多语言用户邮件,3个客服专员连轴转还是有40%的工单要拖到24小时以上才能回复,用户差评率直接涨了18%。临时招兼职不仅培训周期赶不上,单月成本还要多掏近2万欧元。

先给没听过的人一句话解释

Claude 3.5 Sonnet是Anthropic在2024年推出的多模态大模型,支持200K上下文窗口的前提下,推理速度比上一代快了2倍,刚好能吃下我们单条工单加近3个月用户历史订单、沟通记录的全部信息。

我们用到的三个核心收益,每个都踩在痛点上

我们把客服工单处理切到Claude 3.5 Sonnet,3个月省了2.1万欧元人力成本 第1张

  • 多语言理解准:我们的用户覆盖德、法、西、意四个语种,之前用小模型处理非英语工单经常把“退款”和“换货”搞混,Sonnet的错判率不到2%,不用额外配翻译工具就能直接处理。
  • 长文档处理稳:用户申请退货时经常附5、6张商品破损照片加几百字描述,Sonnet能一次性看完图片、文字和过往订单记录,直接生成符合我们售后规则的处理方案,不用人工再核对信息。
  • 成本够低:我们测下来处理1000封工单的token成本不到10欧元,就算加上网关和微调的费用,每个月的总开销也不到一个全职客服月薪的1/5。

切到Sonnet的第一个月,我们的工单平均响应时间就从17小时降到了1.5小时,客服不用再处理重复的退货、查物流咨询,只需要处理10%左右的复杂纠纷,大促期间也没再加人。

别光看好处,我们前两周踩了两个实打实的坑

第一个是复杂规则识别的幻觉问题:我们有个小众规则是“定制商品超过7天但质量问题依然可以退款”,一开始直接把规则喂给模型,它依然会按通用的“定制商品不退不换”拒绝用户,后来我们把这类特殊规则单独做成了触发式prompt,出现相关关键词就优先调用,才解决了问题。

第二个是限流:大促当天峰值请求是平时的3倍,一开始没做降级策略,有部分请求直接返回了429,后来我们加了个简单的排队机制,把非紧急的工单延迟10分钟处理,就没再出现过失败的情况。

明确说:谁适合用,谁完全没必要碰

我们把客服工单处理切到Claude 3.5 Sonnet,3个月省了2.1万欧元人力成本 第2张

如果你的团队符合这两个条件之一,直接用不会错:一是需要处理大量长文本、多模态的结构化任务,比如客服工单、合同审核、长文档摘要;二是业务覆盖多语言地区,不想单独为每个语种做模型微调。

要是你只是需要做简单的关键词回复、短文本分类,或者对数据隐私要求极高、完全不能把数据传到第三方模型,那没必要选它,用小模型甚至规则引擎就足够了。

给第一次用的人的两个实操建议

第一次测试别直接全量切,先拿过去1个月已经处理完的历史工单跑一遍,把模型输出的结果和人工处理的结果做对比,准确率到90%以上再上线,能避开80%的规则适配问题。

如果你的请求波动大,一定要做个简单的降级队列:Sonnet的免费额度限流挺严的,高峰期把优先级低的任务往后排,不用额外花更高的费用买专属吞吐量,就能满足大部分中小企业的需求。

几个你可能会问的问题

Q:需要专门做微调吗?A:我们只是把售后规则写到了prompt里,没做微调,准确率就已经够用了,除非你的业务规则特别复杂,不然不用花这个钱。

Q:和GPT-4o比哪个划算?A:我们测下来处理同样的工单,Sonnet的成本要低30%左右,准确率差不多,对成本敏感的中小企业选前者更合适。

有用吗?

技术支持在线客服
侧栏
返回顶部