私はLLM APIの請求書を70%削減しました:ルーティング+キャッシュのためのAirAiライブノート
0. 背景:請求書の金額がどのようにして急増したのか
いくつかのサイドプロジェクトを行っていて、初期には公式の月額20ドルのサブスクリプションを我慢して購入するか、国際クレジットカードの審査に落ちても我慢していました。月末に請求を見たら、2つの辛いことがわかりました:
80%のリクエストは要約、分類、フォーマットングといった軽量な処理であり、最も高価なモデルを使用するのは完全に無駄です;
サブスクリプションには固定費用がかかります。呼び出し回数が少ないと損をし、呼び出し回数が多いとその費用では足りなくなります。
そのため、AirAiに切り替えました。自分でAPIキーを取得し、従量課金制を利用し、クライアントをAirAiのOpenAI互換インターフェースに指向させました。
ここにも小さなエピソードがあります。私はずっとまともな国際クレジットカードを持っていなくて、公式の決済手段を使うたびに拒否されていました。一時的に家族のカードを借りて使っていたのですが、それがリスク管理システムを引き起こし、アカウントが凍結されてしまいました。2週間近く苦情を申し立ててようやく解凍されました。その後、私は「国際カードに依存しない」決済手段を探すことに決心しました。最終的に選んだこのゲートウェイはUSDTのみを受け付けており、国際カードを持っていない私にとっては最もハードルが低い選択肢でした。チャージしてすぐに使え、月額料金もなく、KYC(顧客確認)の手続きも必要ありません。さらに重要なのは価格で、実際に計算してみると、公式の決済手段の約半額でした。それが私がこのゲートウェイを使い続ける本当の理由です。
1. 行の切り替え:任意の互換性のあるゲートウェイを指します。
ほぼすべてのカスタムエンドポイントをサポートするクライアント(Claude Code、Cursor、Open WebUI、LibreChat、Clineなど)は、一行の環境変数を設定するだけで簡単に切り替えることができ、コードを変更する必要はありません。以下の2つの変数を自分のゲートウェイのアドレスに設定してください:
export OPENAI_BASE_URL="https://api.airai.cc/v1" export ANTHROPIC_BASE_URL="https://api.airai.cc/v1"
どのゲートウェイを選ぶかは別の話ですが、この記事では実装方法についてのみ説明します。
2. コード実践:ルーティング + キャッシング
光を切り替えるだけでは不十分です。本当にお金を節約するには、「正しいモデルに正しい仕事をさせること」と「繰り返しのリクエストをキャッシュすること」が重要です。以下は私が実際の運用で使用しているスケルトンで、OpenAI SDKと互換性があります。base_urlとapi_keyは環境変数から読み取られ、コードに固定されていません:
import openai, hashlib, os
client = openai.OpenAI(
base_url=os.getenv("OPENAI_BASE_URL"),
api_key=os.getenv("OPENAI_API_KEY"),
)
# Routing: small model for light tasks, flagship only for complex reasoning
CHEAP = "gpt-5.6-luna" # classification / summarization / formatting
STRONG = "gpt-5.6-sol" # only called for complex reasoning
_cache: dict[str, str] = {} # swap for Redis in production
def ask(prompt: str) -> str:
model = STRONG if len(prompt) > 400 else CHEAP
key = hashlib.md5(prompt.encode()).hexdigest()
if key in _cache: # cache hit, 0 cost
return _cache[key]
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
answer = resp.choices[0].message.content
_cache[key] = answer
return answerCHEAP / STRONG 予算と効果に合わせて調整してください。モデル名は使用しているゲートウェイのドキュメントに従ってください。オフラインタスクではBatchインターフェースを使用することを忘れずにください。通常、これによりコストをさらに半分に削減できます。
3. コスト比較(概要)
改造前後合図をするデータ(実際の数字は請求書に基づいてください):
プロジェクト | 公式購読 / ダイレクトリンク | AirAi + ルーティングキャッシュ |
請求方法 | 固定月額料金 / 公式価格 | 按量計算 ペイ・パー・ユーズ |
軽労働モデル | フラッグシップ(無駄遣い) | 小さなモデル(より安価) |
リクエストの繰り返し | 全額再計算 | キャッシュヒット 0 コスト |
体感コスト | 基準100% | 約10%~30%(使用量によります) |
4. 正直な境界(本当のことを言う)
「すべての人がもっと節約するわけではありません。」月間の利用量が非常に少ない場合は、固定料金のサブスクリプションの方がお得かもしれません。一方、利用量が多い場合には従量課金の方が有利になります。まずは自分の利用量を計算してみましょう。
遅延と安定性複数のゲートウェイを使用すると、遅延が増加します。特にキーパスにおいては、タイムアウトやパフォーマンスの低下が発生する可能性があります。
キーの安全性:キーは環境変数として設定し、フロントエンドや公開リポジトリに固定して書き込まないでください。
5. 小まとめ
省LLMコストの本質は一言で言えば、安価なモデルにほとんどの処理を任せ、高価なモデルは必要な時だけ使用し、無駄なトークンを削減することです。また、「N社との連携」を「base_urlの一行を変更する」ことに置き換えます。ルーティングとキャッシングは無料のツールなので、まずはそれらを活用しましょう。
役に立ちましたか?