GPT-4oを使用して多モダルカスタマーサービスの正解率を92%まで引き上げましたが、その過程で3つの大きな問題に直面しました。
先月、私たちの東南アジアにおける越境Eコマースの技術チーム3人で3日間徹夜し、インテリジェントカスタマーサービスシステムを古いテキストベースの大規模モデルからGPT-4oに切り替えました。当初は画像認識機能を追加するだけだと思っていましたが、実際には予想以上の大きな変化があり、予期せぬ問題にも多く直面しました。
初めて聞く方のために、GPT-4oとは何かを詳しく説明します。
その本質はOpenAIの多モダル生成モデルであり、前世代と比べて最も大きな違いは一度の処理でテキスト、画像、音声の3種類の入力を同時に処理でき、別々のモデルを呼び出すためにリクエストを分割する必要はありません。、自分で入力フォーマットの前処理を行う必要がなく、インターフェースパラメータは組み合わせて呼び出す場合よりも約60%少なくなります。
なぜ私たちは2026年というタイミングでそれを変更しなければならないのでしょうか?
以前のカスタマーサービスシステムではテキストによる問い合わせのみを処理でき、ユーザーが商品の破損や誤配送の写真を撮影した場合、それを手動でテキストに変換してからモデルに入力する必要がありました。このプロセスだけでセールスイベント中に約20%の問い合わせが滞り、ユーザーの苦情率も倍増しました。画像認識モデルとテキスト認識モデルを組み合わせたソリューションも試しましたが、精度は76%にとどまり、誤判によるアフターサービスの請求による損失はモデルの費用を上回りました。
翻訳後のテキスト: 「交換後の最も顕著な3つの利益は、私たちの当初の予想を完全に上回りました。」

- アフターサービスのチケット処理率が47%から92%に直接上昇しました。元々画像のテキスト変換を担当していたアルバイトのカスタマーサービススタッフ2名が、より複雑な顧客からの苦情処理に移動したため、月間の人件費が約1800ドル節約されました。
- ユーザーが発した方言の音声コンサルティングは、もはや別のASR(自動音声認識)インターフェースを経由する必要がなく、直接モデルに送信するだけで認識され、返答が得られます。ほとんどのリクエストは15ミリ秒以内に処理され、全体の応答速度が3倍に向上しました。
- 同じ画像とテキストが含まれるアフターサービスのリクエストを処理する場合、トークンの消費量は画像認識とテキストモデルを個別に呼び出す場合よりも32%少なくなりました。その結果、大規模なセールのピーク時におけるモデルのコストは以前よりもさらに低くなりました。
良い点だけを見てはいけません。これら3つの隠れた落とし穴には、私たちが実際に遭遇した時に本当の損失が伴いました。
最初の問題は、マルチモーダル入力のリクエストに対する制限値がテキストのみのリクエストよりもはるかに厳しいことでした。サービスを開始した初日にちょうど東南アジアのサイトで店舗の記念イベントがあり、画像を含むリクエストの17%が429エラーとして返されました。ユーザー側では返答が表示されず、カスタマーサービスが対応を放棄したと思われ、その日だけで300件以上の悪評が寄せられました。その後、画像を含むリクエストには別の処理キューを設けるしかなく、ピーク時には「画像を受け取りました。処理中です」というメッセージを返すようにして問題を解決しました。
第二の問題点は、このサービスが英語以外の小言語の画像テキスト認識において、宣伝されているほどの精度を持っていないことです。インドネシア語で書かれた手書きの宅配伝票をユーザーから受け取った際、モデルが3つの住所の文字を誤認識し、ユーザーに間違った返品・交換先を指定してしまいました。その結果、往復の送料で約200ドルの損失が発生しました。現在では、小言語の画像認識にローカルのOCR(光学文字認識)インターフェースを追加して検証を行うことで、誤認率を許容できる範囲に抑えています。
第三の問題点は、マルチモーダル出力のトークンカウントルールがテキストのみの場合とは全く異なるため、以前の公式を使ってコストを見積もることができないという点です。サービスを開始したその週には予算のアラート閾値を変更していなかったため、週末の1日だけで月間予算の40%を超えてしまい、財務部からのリマインダーを受けて初めて気づきました。
結局、今すぐ変更するべきかどうか?私たちは明確な判断基準をまとめました。
直接行動できる状況:

- あなたのビジネス自体が、テキスト、画像、音声のうち2つ以上の入力を同時に処理する必要があります。
- 以前は複数のモデルを組み合わせて多モーダル処理を行っていましたが、統合コストが高く、精度も十分ではありませんでした。
- あなたのユーザーは主に英語を使用していますが、GPT-4oがよりよくサポートしている主流の言語も使用しています。
お金を無駄にする必要が全くない場合:
- あなたのビジネスでは純粋なテキスト処理のみが必要であり、以前のモデルで既に正確性の要件を満たすことができています。
- あなたのビジネスは主に小言語市場を対象としており、大量のローカルな手書きテキストや方言の音声認識のニーズに関わっています。
- あなたのチームには、ダウングレード戦略やコスト管理のためのサポート開発を行う余裕の人員がいません。
新人向けのチームへの2つの実践的なアドバイス
まず、リリース前に7日間のシャドートラフィックをテストしてください。すぐに100%のリクエストを切り替えないでください。実際のユーザーのリクエストを元のシステムとGPT-4oの両方に送り、両者の精度とコストを比較して、期待に合致してから徐々にトラフィックを切り替えてください。私たちはこのステップを怠ったために大きな損失を被りました。
第二に、マルチモーダルリクエストに対しては別途予算アラートを設定し、閾値を予想費用の120%に設定することで、コスト超過を防ぐことができます。
よくある質問とその回答
質問:次世代のモデルが出るまで待ってから変更するべきでしょうか?
答:少なくとも多モダル統合のシナリオにおいては、GPT-4oの現在の成熟度は実際の問題を解決するのに十分です。次世代モデルが登場するまでには少なくとも1年以上かかるでしょうから、不確実なアップグレードのために今節約できるコストを無駄にする必要はありません。
質問:オープンソースの多モーダルモデルと比べて、コストパフォーマンスはどうですか?
答:もしあなたのチームがオープンソースモデルを自分で微調整し、デプロイする能力があり、かつデータのプライバシーに高い要求がある場合は、オープンソースモデルの方がコストパフォーマンスが良いでしょう。そうでなければ、GPT-4oを直接使用する方が、自分でサーバーを構築し運用するコストよりもはるかに安上がりです。
役に立ちましたか?