メニュー

o1-miniを使ってサプライチェーン予測を行った結果、推論コストを62%削減できましたが、2つの致命的な問題に直面しました。

先月のブラックフライデーには、私たちのチームが危うく大失敗しそうになりました。
以前は大規模なモデルを使用して北米地域の在庫管理の需要予測を行っていましたが、ピーク時には連続3日間で18%以上のリクエストが429エラーとして返され、運営側の在庫計画が混乱し、3つの州でベストセラー商品の配送が48時間遅れました。
モデルを切り替える必要があった際には、最初にP0を選択しました。4つの代替案を7日間かけてテストした結果、最終的にo1-miniを採用しました。それから22日が経過し、問題はすべて解決しましたが、事前に誰も指摘していなかった落とし穴にも遭遇しました。

まず、聞いたことがない人のためにはっきりさせておきますが、「o1-mini」とは一体何でしょうか?

OpenAIが発表した軽量級推論モデルで、論理的なタスクや計算処理の速度を特に最適化しています。基本的な推論能力は主要な大規模モデルと比べて8%以内の差があり、単一トークンのコストは主要モデルの7分の1に過ぎません。。
私たちは最初からこのコスト差を目指していました。結局のところ、私たちの予測タスクでは3000以上のトークンを含む過去の注文データ、天気情報、祝日データを一度に処理し、1日に約2万回も実行しなければなりません。

最も直感的な3つの利益については、実際に手に入れました。

  • まず、リミット制御の問題が完全に解消されました。o1-miniの単一アカウントに対するリミット値は、以前使用していたモデルの12倍になっており、ブラックフライデーの日にピークが発生しても429エラーが一度も発生しませんでした。運用側の計画による出力には遅延が一切ありませんでした。
  • コストが大幅に削減されました:私たちのバックエンドの請求データによると、同じ予測タスクを実行した場合、月間の推論コストが1万2000ドルから4500ドルに削減されました。、節約したお金を使って、3つの倉庫のリアルタイムデータポイントを追加しました。
  • 処理速度が非常に速く、リアルタイムでの調整が可能になりました。以前のモデルでは予測を一度実行するのに20秒以上かかっていましたが、現在ではほとんどのリクエストが15ミリ秒以内に処理されます。また、予測データの更新頻度も以前の1日に1回から2時間ごとに1回に変更しました。その結果、在庫不足率が直接4ポイント減少しました。

しかし、2つの問題があり、それに直面したときにはほとんどリロードしそうになりました。

Abstract representation of a multimodal model with dots and lines on a white background.

最初の問題点は、非構造化データの処理能力が非常に低いことです。
以前の入力データには、ユーザーがソーシャルプラットフォームで議論しているキーワードが含まれており、需要の変動を参考にしていました。しかし、o1-miniはこれらの情報を無効なものとして扱い、過去3日間の予測データが実際の需要を20%下回ってしまいました。幸いにもクロスチェックの仕組みがあったので、実際に在庫を増やすことはありませんでした。
最終的には、このデータを処理するために小さなテキスト分析モデルを単独で実行し、構造化されたスコアに変換してからo1-miniに入力するしかありません。そうすることで問題を解決できます。

第二の問題点は、その多言語処理に隠れたバイアスがあることです。
カナダ地域の予測データにはフランス語の地名や商品名が含まれており、o1-miniはデフォルトで一部のフランス語のカテゴリを英語の類似カテゴリにマッピングしてしまいます。その結果、ケベック地域のスキー用品の予測値が半分になってしまいました。後でプロンプトに元の言語を保持するルールを追加したことで問題を解決しましたが、公式のドキュメントではこの件について一切言及されていません。

誰が使うべきで、誰が使うべきでないか、私たちが線を引いておきます。

もしあなたが私たちと同じように、論理推論、数値計算、ルールベースの意思決定タスクの入力が構造化データ中心であり、コストと並行処理の要件が高い場合、o1-miniはほぼ問題なく対応できると言えます。
しかし、もしあなたが行いたいのがコンテンツ生成、マルチモーダル理解、複雑な多言語処理であれば、それは避けた方がいいでしょう。そうすると予期せぬエラーが大量に発生し、そのトラブルシューティングにかかるコストは節約したお金よりもはるかに高くなるでしょう。

初めての方への2つの具体的なアドバイス

まず、リリース前には少なくとも7日間の並行検証を行う必要があります。直接トラフィックを切り替えてはいけません。
最初は手間を省くために3日間だけ実施しましたが、フランス語の入力シナリオに遭遇しなかったため、大きな問題にはなりませんでした。7日間のサイクルであれば、お客様のビジネスにおけるほとんどのエッジケースをカバーできるでしょう。

第二に、その温度設定値を勝手に変更しないでください。
最初は結果をより柔軟にするために温度を0.7に設定しましたが、その結果、予測データの変動が大きくて使用できないほどでした。後で公式に推奨されている0.1-0.3の範囲に戻すと安定しました。このシステムの目的は確定的な推論を行うことなので、創造性が必要な場合は大規模なモデルを直接使用した方が良いでしょう。

最後によく聞かれる質問ですが、次のバージョンが出るのを待つべきでしょうか?
少なくともサプライチェーン予測のシナリオでは、現在のo1-miniで十分です。計算した結果、次世代バージョンが20%安くなっても、今節約できている人的コストや故障によるコストには及びません。早く導入すれば早く利益を得られます。

役に立ちましたか?

テクニカルサポートオンラインサポート
侧栏
トップへ戻る
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR