GPT-4 Turboのおかげでプロモーションシーズン中のリクエストエラー率を0.2%に抑えることができました。これら3つの落とし穴にはもうはまらないでください。
先月のブラックフライデーセールの際、私たち3人で構成されるヨーロッパ向けのクロスボーダーロジスティクスチームは、初めて顧客の住所検証リクエストによって全員が一晩中対応しなければならない事態になりませんでした。
昨年の同じ時期には、通常のGPT-4を使用して住所の標準化を行っていましたが、ピーク時には13%のリクエストが直接429エラーとして返され、顧客からの苦情処理だけで36時間を要しました。今年はGPT-4 Turboに切り替えた結果、一度もリミットが発生することなく、エラー率を大幅に下げることができました。0.2%。
まずは、GPT-4 Turboとは何かを理解しましょう。
簡単に言うと、OpenAIがGPT-4をベースにしてパフォーマンスを向上させた高スループット版で、その核心的なパラメータのアンカーポイントは単一アカウントが1分間にサポートできるリクエスト量は、通常のGPT-4の6倍です。、そして単一トークンのコストも半分になりました。これは高並行処理のシナリオに特化した最適化です。
中小規模の技術チームにとっての3つの実際のメリット
最初の最も直接的な利点は、もうリミットリングの問題に頭を悩ませる必要がないことです。私たちは1日に50万件のアドレス解決リクエストを処理しており、以前は3つの異なるプラットフォームの大規模モデルを使って負荷分散を行っていました。ゲートウェイの適応だけで1000行以上のコードを書かなければなりませんでしたが、今ではGPT-4 Turboを1つだけ使用するだけで、プロモーションシーズンの3倍のピークトラフィックにも対応できます。
二つ目は、長文処理の効率が高いことです。私たちはよく、1ページ分の国境を越える通関申告書全体を入力して情報を抽出する必要がありますが、以前は通常のGPT-4では文脈の長さが不足しているために3回に分けて処理する必要がありました。しかし今では一度で処理できるようになり、単一タスクの処理時間が約3分の2に短縮されました。
三つ目はコストの大幅な削減です。先月の請求書を計算してみたところ、同じリクエスト量でGPT-4 Turboのコストは以前の多モデルハイブリッドソリューションの28%にしかならず、節約したお金をチームのボーナスとして2ヶ月分支給しました。
良い点だけを見ているわけにはいきません。これら3つの落とし穴には私たちも実際にはまってしまいました。

最初の問題は、低コストなタスクが実際には割に合わないということでした。最初はすべてのアドレス検証リクエストをそのまま処理していましたが、後に「アドレスがEUに属しているかどうか」という簡単な判断をGPT-4 Turboを使用すると、軽量モデルを使用するよりもコストが3倍高くなることがわかりました。そのため、現在ではこのような簡単なリクエストをより小規模なモデルに割り当てて処理しています。
第二の問題点は、デフォルトの応答時間が通常のGPT-4よりもわずかに長いことです。切り替えた当初、一部のリクエストで200ms以上待たなければならないことがありましたが、後で高スループットモードではリクエストが拒否されないように優先されるためであり、極端な低遅延ではないことがわかりました。迅速な応答が必要なフロントエンドのクエリリクエストには低遅延パラメータを設定することで問題を解決しました。
第三の問題点は、細かい粒度での権限制御がより限られていることです。通常のGPT-4では、モデルの温度やtop_pなどのパラメータを非常に精密な範囲でカスタマイズすることができますが、GPT-4 Turboではその調整範囲が大幅に狭まっています。そのため、出力スタイルを正確に制御する必要があるシナリオ(例えば、顧客向けに生成する通関通知のテキストなど)では、やはり通常版に戻す必要があります。
誰がそれを使うべきなのか?誰にとっては、この騒ぎに参加する必要がないのか?
もしあなたが中小規模のチームであり、以下の3つの条件に当てはまる場合は、すぐに行動してください:
- 1日あたりに10万回以上の大規模モデルに対する高並行処理リクエストがあります。
- 頻繁に8kを超える長いテキストのタスクを処理する必要があります。
- 以前は、トラフィック制限のためにモデル間の負荷分散を行う必要がよくありました。
もしチームの1日あたりのリクエスト量が1万件未満である場合、または単純な分類や抽出タスクのみであれば、モデルを変更する必要は全くありません。軽量なモデルで十分対応でき、コストもさらに低く抑えることができます。
上達するための2つの具体的なアドバイス
第一週は全量を切り替えないでください。まずは高コンカレンスの長文リクエストの10%をグレースケールで移行し、1週間の監視データを確認した後に徐々に量を増やしていきましょう。実際には初日に30%を切り替えてしまい、パラメータの適応が不十分だったために一部の通関書類の抽出にエラーが発生しました。
長い文脈を事前に準備する必要はありません。GPT-4 Turboの128kのコンテキスト容量は、ほとんどの企業レベルのシナリオに十分対応できます。実際に30ページに及ぶ物流契約の全文を入力して条項のチェックを行ったところ、出力の正確性や処理の段階に違いは全くありませんでした。
皆さんがよく尋ねる2つの質問
Q:普通のGPT-4よりも出力の質が悪くなることはありますか?
A:1000件のアドレス検証用テストセットを実行した結果、正確率は98.7%でした。これは通常のGPT-4の98.9%とほとんど変わらず、企業レベルのシナリオでは十分に使用できます。
Q:プロンプトエンジニアリングをやり直す必要がありますか?
A:以前に通常のGPT-4用に作成したすべてのプロンプトをそのまま再利用しました。何の調整もせずに使用したところ、出力結果は完全に予想通りでした。
役に立ちましたか?