メニュー

Claude 3を使用して顧客のアフターサービスのチケット処理効率を3倍に向上させましたが、避けるべき2つの問題に直面しました。

先週のブラックフライデーが終わり、レポートを作成していた時、私たちの東南アジア向けEコマースSaaSチームの3人の開発者はバックエンドデータを見て半日ぼんやりしていました。以前はカスタマーサービスチームが3日間連続で働かなければ処理できなかったアフターサービスの問い合わせが、今年はほとんどが自動的に処理され、顧客の苦情件数が42%も減少しました。核心的な変更点はただ一つでした。それは、元の問い合わせの意味認識ロジックをすべてClaude 3 Opusに置き換えたことです。

初めてこの分野に触れる方に正直な話をします。

それはAnthropicが2024年に発表した第3世代の大規模言語モデルで、実際に使用してみたところ、コアパラメータの設定が非常にシンプルでした。200kのコンテキストウィンドウの下で、3枚の商品のスクリーンショットが含まれるアフターサービスのチケットを処理する際の精度は、以前使用していた同じパラメータレベルのモデルよりも18%向上しました。

私たちのような小規模なチームにとって、3つの収益源は非常に大きな意味を持ちます。

Abstract black and white graphic featuring a multimodal model pattern with various shapes.

最初の改善点は、多モーダルの前処理を別途行う必要がなくなったことです。以前は、ユーザーがアップロードした破損した商品の画像や物流のスクリーンショットについて、まずOCRモデルを使ってテキストに変換し、そのテキストをテキストのワークフローに組み込んで大規模なモデルに入力していました。この処理フローのメンテナンスだけでバックエンドのリソースの半分を消費していました。Claude 3を導入してからは、画像とテキストを一緒に直接送信するようになり、認識の誤りや漏れが減少しました。

二つ目は、拒否率が非常に低く、ほとんど無視できるほどです。以前のモデルでは、ユーザーが非常に乱雑に書いたチケット(例えば、半分が英語で半分が現地語で、ネットワークの略語が混在しているなど)に遭遇すると、認識できないとして直接人の手に渡されることがよくありました。統計によると、その時期の人の手に渡る割合は27%でしたが、現在はその数字が4%になっています。

三つ目は、コールのコストが私たちの予想を大幅に下回りました。実際の使用量に応じて料金を支払うため、ブラックフライデーのピーク時には1日あたり1.2万件のチケットを処理しましたが、総費用は800ドル未満でした。これは10人の臨時カスタマーサービススタッフを雇うコストの90%を節約できたことに相当します。

でも急いで行動する必要はありません。私たちが踏んだ2つの間違いだけで、1週間無駄になるほどです。

最初の問題は多言語対応のアライメントでした。ユーザーの半分がインドネシア語を使用していたにもかかわらず、最初は微調整を行わずにサービスを開始してしまいました。その結果、現地特有のスラングが使われた場合、モデルは「商品の色が間違っている」という表現を「ユーザーが受取先住所を変更したい」と誤解してしまい、1週間で17件もの苦情が寄せられました。その後、3000件の現地語に関するラベル付けされたデータを使ってモデルを微調整したところ、問題が解決しました。

二つ目の問題は、長い文脈の中で情報が欠落することです。もしチケットに5枚以上の画像が添付されている場合、モデルは時々中央の画像の情報を見落とすことがあります。例えば、ユーザーが包装の破損と商品の破損の2枚の画像を撮影したとしても、モデルは包装の問題しか認識できません。その後、私たちは簡単な検証ルールを追加しました。画像が3枚を超える場合は、モデルにまず一枚ずつ認識結果を出力させ、その後でまとめて処理するようにしたところ、問題は再発しませんでした。

正直言って、すべてのチームがそれを使用するのに適しているわけではありません。

Abstract representation of a multimodal model with dots and lines on a white background.

使用場合:

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

  • あなたのビジネスでは、テキストと画像/短音声の両方を同時に処理する必要がありますが、複数のモデルチェーンを構築したくありません。
  • あなたは出力の精度に非常に高い要求をしています。例えば、チケット処理や契約の審査のような、エラーが発生するとコストがかかるシナリオにおいてです。
  • あなたのチームの人手が不足しており、複雑なモデルの前処理フローのメンテナンスをする余裕がありません。

お金を無駄にしないための状況:

  • あなたは単に簡単なキーワードに基づいた返答をしたり、マーケティングコピーのような軽量なタスクを生成するだけでいいのです。安価な小さなモデルで十分です。
  • あなたのビジネスデータには厳格なローカライゼーションストレージの要件があり、データを第三者のモデルインターフェースに送信することができません。
  • あなたのリクエスト量は非常に少なく、月に1000回にも満たないため、モデルを変更する開発コストが収益を上回ってしまいます。

初めての方への実践的なアドバイス2つ

最初はエッジシナリオで7日間テストを行った後、コアリンクに導入しました。最初は過去3ヶ月分のヒストリックなチケットを使ってオフラインテストを行い、精度が95%を超えた後でオンライントラフィックの10%を切り替え、徐々に全量に増やしていきました。その間、大きなオンライン障害は発生していません。

二つ目は、最初から最も高価なOpusバージョンを選択する必要はないということです。私たちのテストによると、画像が含まれていない一般的な問い合わせファイルを処理する場合、Sonnetバージョンの精度はOpusとほとんど変わらず、コストは半分になります。これで十分です。

最後によく聞かれる質問ですが、「次世代のモデルを待つべきか?」ということです。私たちの答えは、もしあなたのビジネスが既にマルチモーダル処理によって制限を受けており、精度の不足が効率を妨げているのであれば、今すぐ使うべきだということです。結局のところ、早く使えば早く人件費を節約できるので、次世代のモデルがもたらすわずかなコール料金の削減よりもずっとメリットがあります。

役に立ちましたか?

テクニカルサポートオンラインサポート
侧栏
トップへ戻る
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR