私たちのチームはGPT-3.5を使用して住所解析のコストを62%削減することに成功しました。また、大規模なセール時のトラフィック制限の問題も解決しました。
先月のブラックフライデーのセール期間中、オランダで国際小包物流を手がける3人のバックエンドチームとしては、初めてサーバーの横で一晩中作業をすることはありませんでした。昨年の同じ時期には、自社で開発した住所訂正モデルの精度が80%にも満たなかったため、別の人を24時間体制でエラーログを監視させていました。その結果、住所の入力ミスだけでパッケージの返送率が11%にも上りました。
初めて聞く方に簡単に説明しますが、GPT-3.5とは何でしょうか?
それは2022年にOpenAIが発表した大規模言語モデルで、2026年現在も継続的に改良が行われている安定版です。この安定版は最大16,000のコンテキストウィンドウをサポートしており、非ストリーミング型の構造化出力リクエストに対する応答速度は一般的に200ミリ秒以内であり、オンラインでの高並行処理や軽量な意味処理のニーズを十分に満たすことができます。
私たちは住所解析の問題を解決するためにこれを選びました。その主な理由は、3つの実際的な利点があるからです。

- 第一に、箱から出してすぐに使用できる高い精度です。何百万もの各国の住所データを自分でラベル付けしてトレーニングする必要はありません。私たちは200件の過去の異常な住所のサンプルだけを使用してフェアショット(few-shot)トレーニングを行い、解析精度を直接向上させることができました。98.7%不良品率が直接1%未満に下がりました。
- 第二に、コストが自社開発のものよりも大幅に低いです。以前は自社開発のモデルと3台のGPUサーバーのメンテナンスに月額1200ユーロかかっていましたが、現在はGPT-3.5を使用して1日あたり50万件のリクエストを処理しており、月額コストはわずか450ユーロになりました。これでコストを62%も削減できました。
- 第三に、拡張に関しては全く自分で心配する必要がありませんでした。ブラックフライデーの期間中、私たちのリクエスト量は3倍に増加しましたが、以前自社で開発したモデルでは最大で1.5倍のトラフィックしか処理できず、すぐにパニックに陥っていました。今回はOpenAIのバックエンドに事前に一時的な増額申請を行っただけで、429エラーが一度も発生しませんでした。
良い点だけを見ているわけにはいきません。過去3ヶ月間に私たちが遭遇した問題の数は、得た利益よりも多かったのです。
最初、私たちは原始の住所情報をそのままモデルに入力していましたが、ヨーロッパの小さな国の村や町の住所がアメリカの都市として認識される問題が頻繁に発生しました。1週間かけて調査した結果、デフォルトのプロンプトに「物流リクエストに含まれる目的地国の情報を優先してマッチングする」というルールが追加されていなかったことが原因であることがわかりました。
またある時、流式出力を誤って起動してしまい、その結果、すべての解析結果の返却時間が3倍に増加してしまいました。ピーク時には2万件ものリクエストがタイムアウトしました。半日かけて調査した末に、同僚がパラメータを変更した際に元に戻すのを忘れていたことが原因であることがわかりました。
最も問題だったのは請求書の件です。最初は入力データのトリミングを行っていなかったため、ユーザーが住所を入力する際に付け加えた余計なコメントもすべてモデルに送信されてしまい、月末の請求書の金額が予想を30%上回ってしまいました。その後、100文字の前処理トリミングルールを導入したところ、2ヶ月目の請求書は正常な金額に戻りました。
結局のところ、GPT-3.5は万能薬ではありません。これら2種類のチームについては、無闇に関わることをお勧めしません。

もしあなたのチームが医療記録や支払い情報のような高度にプライベートなデータを扱う場合は、たとえGPT-3.5が安価で使いやすくても、公開版のGPT-3.5を使用しないでください。データコンプライアンスのリスクは避けられません。
もしあなたが数万語に及ぶ専門的な文書を作成したり、複雑な論理的推論を行う必要があるなら、GPT-4oやClaude 3を選ぶべきです。GPT-3.5はこのようなタスクにおいて正確性がかなり低いので、わずかなコストの節約は屁のためにも無駄です。
逆に、ユーザーの意図分類、短文の誤り訂正、構造化情報の抽出などの軽量なセマンティックタスクを行い、極端な推論が必要ない場合、GPT-3.5は2026年まで最もコストパフォーマンスに優れた選択肢であり、他に類を見ません。
初めて使う方のために3つの実践的なアドバイスをお伝えします。これらは私たちが実際に失敗した経験から得たものです。
- リリース前に7日間のシャドウトラフィックを実施してください:現在のシステムとGPT-3.5の両方にリクエストを送り、結果のみを比較します。トラフィックは切り替えずに、精度と速度が期待に合致していることを確認してから、全量で置き換えてください。
- すべての入力に前置きフィルタリングを適用しましょう:余分なスペース、関係のないメモ、特殊な文字を事前にすべて除去することで、トークンの使用量を少なくとも20%削減でき、モデルの誤判の可能性も低減できます。
- 必ず代替案を用意しておく必要があります。もしOpenAIのインターフェースがダウンした場合には、精度が低くても、サービス全体が完全に利用できなくなるよりはましだからです。
FAQ
2026年になっても新しいモデルがたくさんあるのに、まだGPT-3.5を使う必要があるのでしょうか?
軽量なタスクにとっては完全に必要です。同じ価格帯のオープンソースモデルと比較したところ、GPT-3.5の精度は少なくとも5ポイント高く、さらに自分で運用やデプロイを行う必要もありません。その結果、総コストはむしろ低くなります。
呼び出す際には、リミットリングについて心配する必要がありますか?
通常のトラフィック量であれば、突然10倍以上に増加することはないので、デフォルトの割り当て量でほとんどの場合十分です。大規模なセールの3日前に申請を行えば、増額が可能です。私たちはこれまでに3回申請しましたが、最速で2時間以内に承認されました。
役に立ちましたか?