メニュー

OpenAI o1を使用して物流住所のマッチング精度を最大限に高めましたが、予期せぬ3つの問題に直面しました。

先週のブラックフライデーのピークが過ぎたところで、ヨーロッパにいる3人のバックエンドチームはようやく安堵の息をつきました。昨年の大規模セールでは、13%のアドレス解決リクエストが単一モデルのリミットによって429エラーとして返されましたが、今年はリミットが一度も発生せず、アドレスマッチングのエラー率も82%も減少しました。主な変更点は、主力の推論モデルをo1に切り替えたことです。

初めて聞く人のためにはっきり説明しますが、o1とは一体何でしょうか?

OpenAIが発表した推論強化型の大規模モデルで、以前のGPT-4oとは異なり、複雑な論理的問題に対してより多くの時間をかけて「考える」ことができます。公式に公開された基本的な推論能力のテストスコアはGPT-4oよりも87%も高く、私たちはこの点に注目してこのモデルを選びました。

中小規模のチームにとって、o1の利点は本当に実感できます。

最初の利点は、私たちが最も頭を悩ませていた住所のマッチング問題を直接解決してくれました。以前GPT-4oを使用していた時は、ヨーロッパの異なる国にある同名の通りや重複する郵便番号をよく混同してしまい、特にユーザーがスペルミスを含んだ住所を入力した場合、3段階のルールチェックを加えてもなんとか92%の精度に達するのがやっとでした。しかし今ではo1によってその精度が98.7%にまで向上しました。そのたくさんのルールコードは先週すべて削除しました。

二つ目は、もう複雑なプロンプトエンジニアリングを行う必要がないことです。以前は、モデルが私たちのバックエンドのフォーマットに合った解析結果を出力するようにするために、2000字近くのプロンプトを書かなければならず、出力フォーマットがずれることもよくありました。しかし今では、一行の指示だけで済み、プロンプトのメンテナンスコストはゼロになりました。

三つ目に、並行リクエストの安定性は想像以上に良かったです。推論に時間がかかるとキューが発生するのではないかと心配していましたが、監視データを見ると、ほとんどのリクエストが15ミリ秒以内に完了しており、特に複雑な国際的なアドレス検索のみが200ミリ秒を超えることがありました。それでも完全に許容範囲内です。

しかし、その落とし穴は本当にあなたを不意打ちで困らせることができる。

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

最初の問題は、GPT-4oに比べてトークンの消費量が大幅に多いことでした。切り替えた最初の3日間で、推論コストが2.3倍に急増しました。その後、o1が自動的に推論プロセスもトークン消費に含めていることがわかりました。もし推論ロジックを見る必要がない場合は、呼び出しパラメータで推論プロセスの出力をオフにする必要があります。そうした後、コストは元の1.2倍に戻り、完全に許容範囲内でした。

二つ目の問題点は、単純で頻度の高いリクエストには適していないことです。最初は手間を省くために、すべてのアドレス検索リクエストをo1に切り替えましたが、スペルミスがなく、フォーマットも標準的なアドレスについては、o1を使用してもGPT-4oを使用しても精度に差はなく、かえってコストが増加してしまいました。そこで、簡単な前置き検証を追加しました。標準的なフォーマットに合致しないリクエストのみがo1を通過するようになり、コストがさらに30%削減されました。

第三の問題は、中国語やアラビア語などラテン文字圏以外の言語に対するサポートがまだ安定していないことです。中東地域のユーザーが少数いますが、アラビア語で入力されたアドレスが時折解析エラーを引き起こします。この問題をOpenAIにフィードバックした後、現在も修正を待っているところです。そのため、当面はローカルのルールを使って追加のチェックを行っています。

誰がo1を使うべきか?今は誰も触ってはいけない?

もし論理的推論が必要なタスクを処理していて——例えば複雑なルールのマッチングや複数の条件のチェック、簡単なコードの生成などで、以前GPT-4oを使用していた際に精度のボトルネックに直面したのであれば、o1に切り替えることをお勧めします。コスト対効果は非常に高いでしょう。

しかし、もしあなたが行っているのが単純なテキスト分類やコンテンツ生成、頻繁な標準化されたリクエストであれば、o1を使う必要は全くありません。それは完全に無駄なお金の使い方です。GPT-4oやGPT-3.5で十分に対応できます。

初めて使う方への2つのヒント

  • まず、以前古いモデルで処理した1000件の歴史データを使ってテストを行ってください。一度に全量を切り替えるのではなく、精度の向上がコストの増加をカバーできるかを迅速に確認できるでしょう。私たちは2日間のテストでモデルを変更することを決定しました。
  • 呼び出す際には、o1-miniバージョンを優先的に選択します。90%の中小規模のチームにとって、o1-miniの機能は十分に満足のいくものであり、価格も完全版のo1よりも60%安いです。

最後に、皆さんがよく質問される問題についてお答えします:o1は他のモデルにすぐに取って代わられるでしょうか?少なくとも私たちが取り組んでいる住所解析のシナリオでは、現在市場に出回っているすべての推論型の大規模モデルをテストしましたが、o1の精度を超えるものはありませんでした。少なくとも今後半年間は、o1が私たちの第一選択肢でしょう。

役に立ちましたか?

テクニカルサポートオンラインサポート
侧栏
トップへ戻る
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR