Menu

Tôi đã giảm chi phí API LLM xuống 70%: Ghi chú thực tế về AirAi liên quan đến định tuyến và lưu trữ đệm

0. Bối cảnh: Tại sao chi phí sử dụng dịch vụ lại tăng vọt như vậy?

Tôi tham gia vào một số dự án bên lề (side projects), và ở giai đoạn đầu, tôi hoặc phải chịu chi phí đăng ký chính thức trị giá $20/mo, hoặc cố gắng sử dụng thẻ tín dụng quốc tế nhưng bị từ chối. Khi tính toán cuối tháng, tôi phát hiện ra hai vấn đề đáng lo ngại:

  1. 80% số yêu cầu (requests) là những công việc nhẹ như tóm tắt (summary), phân loại (classification), định dạng (formatting); việc sử dụng mô hình đắt nhất để xử lý chúng thực sự là lãng phí;

  1. Chi phí đăng ký là một khoản cố định – khi số lượng yêu cầu ít thì lỗ vốn, còn khi số lượng yêu cầu nhiều thì lại không đủ nguồn lực để xử lý.

Vì vậy, tôi đã chuyển sang sử dụng AirAi: tự mình lấy khóa API, thanh toán theo lượng dữ liệu sử dụng, và hướng dẫn phía khách hàng sử dụng giao diện tương thích với OpenAI của nó.

Và đây là một đoạn ngắn. Trên tay tôi vẫn chưa có thẻ tín dụng quốc tế như thế nào, chính thức trực tiếp mỗi lần đi đến bước thanh toán đó đều bị từ chối; có một thời gian mượn thẻ của gia đình, kết quả kích hoạt kiểm soát rủi ro, tài khoản trực tiếp bị đóng băng, khiếu nại gần hai tuần mới giải quyết. Sau đó, tôi quyết tâm chỉ tìm kênh "không phụ thuộc vào thẻ quốc tế". Cổng cuối cùng này chỉ nhận USDT - đối với những người không có thẻ quốc tế như tôi, ngược lại là mức thấp nhất: nạp tiền ngay khi sử dụng, không có phí hàng tháng ràng buộc, cũng không cần đi bộ KYC. Quan trọng hơn chính là giá cả: Tôi cảm nhận được, đơn giá chỉ giảm khoảng 1 phần trăm liên kết trực tiếp chính thức, đây mới là lý do nó thực sự khiến tôi ở lại.

1. Chuyển đổi giữa các gateway: Chỉ cần chỉ định một gateway tương thích bất kỳ là được

Hầu hết các client hỗ trợ endpoint tùy chỉnh (Claude Code, Cursor, Open WebUI, LibreChat, Cline…) đều có thể thay đổi gateway bằng cách sử dụng các biến môi trường trong một dòng lệnh, mà không cần phải thay đổi mã nguồn. Chỉ cần thiết lập hai biến sau đây để trỏ đến gateway của bạn là được:

export OPENAI_BASE_URL="https://api.airai.cc/v1"
export ANTHROPIC_BASE_URL="https://api.airai.cc/v1"

Việc chọn gateway nào để sử dụng là một vấn đề khác; bài viết này chỉ tập trung vào cách thực hiện thực tế.

2. Thực hành lập trình: Định tuyến (Routing) + Lưu trữ đệm (Caching)

Chỉ đơn giản là chuyển đổi nguồn sáng thôi là chưa đủ; điều thực sự giúp tiết kiệm chi phí là “sử dụng đúng mô hình cho công việc cần thực hiện + lưu trữ các yêu cầu lặp lại”. Dưới đây là khung cơ bản mà tôi đang sử dụng trong sản xuất (tương thích với OpenAI SDK); cả base_url và api_key đều được lấy từ biến môi trường, không được ghi cố định trong mã nguồn:

import openai, hashlib, os

client = openai.OpenAI(
    base_url=os.getenv("OPENAI_BASE_URL"),
    api_key=os.getenv("OPENAI_API_KEY"),
)

# Routing: small model for light tasks, flagship only for complex reasoning
CHEAP  = "gpt-5.6-luna"   # classification / summarization / formatting
STRONG = "gpt-5.6-sol"    # only called for complex reasoning

_cache: dict[str, str] = {}   # swap for Redis in production

def ask(prompt: str) -> str:
    model = STRONG if len(prompt) > 400 else CHEAP
    key = hashlib.md5(prompt.encode()).hexdigest()
    if key in _cache:                      # cache hit, 0 cost
        return _cache[key]
    resp = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    answer = resp.choices[0].message.content
    _cache[key] = answer
    return answer

Hãy điều chỉnh các thông số như CHEAP và STRONG theo ngân sách và yêu cầu về hiệu quả của bạn. Tên mô hình nên được đặt theo tài liệu hướng dẫn của gateway mà bạn đang sử dụng. Đừng quên sử dụng giao diện Batch cho các tác vụ ngoại tuyến; điều này thường giúp tiết kiệm thêm một nửa chi phí.

3. So sánh chi phí (minh họa)

Trước và sau khi cải tạoMinh họaDữ liệu (vui lòng dựa vào hóa đơn thực tế của bạn):

Dự án

Đăng ký chính thức / Kết nối trực tiếp

AirAi + Đệm đường dẫn

Phương thức thanh toán

Phí cố định hàng tháng / Giá chính thức

Thanh toán theo lượng sử dụng

Mô hình nhẹ

Phiên bản cao cấp (tốn kém)

Các mô hình nhỏ (rẻ hơn)

Yêu cầu lặp lại

Tính toán lại toàn bộ giá trị

Số lần truy cập vào bộ đệm: 0 (không tốn chi phí)

Chi phí về mặt trải nghiệm người dùng

Độ chính xác: 100%

Khoảng 10–30% (tùy vào lượng yêu cầu)

4. Nói thật một chút

  • Không phải tất cả mọi người đều tiết kiệm được chi phí:Khi lượng yêu cầu hàng tháng thấp, việc đăng ký theo gói cố định có thể tiết kiệm chi phí hơn; phương thức tính phí theo lượng sẽ có lợi khi lượng yêu cầu cao. Hãy tính toán trước lượng yêu cầu của bạn.

  • Độ trễ và độ ổn định:Việc thêm một lớp gateway sẽ gây ra độ trễ nhỏ; các đường dẫn quan trọng có thể gặp vấn đề về thời gian hoặc giảm chất lượng dịch vụ.

  • Bảo mật khóa:Hãy lưu trữ khóa trong biến môi trường, đừng ghi chúng cố định ở phía trước hoặc trong kho lưu trữ công khai.

5. Tóm tắt

Bản chất của việc tiết kiệm chi phí sử dụng các mô hình LLM (Large Language Models) có thể được tóm tắt trong một câu: sử dụng những mô hình rẻ tiền để thực hiện hầu hết công việc, chỉ sử dụng những mô hình đắt tiền khi thực sự cần thiết, và loại bỏ những phần không cần thiết (những “token” lãng phí); thay vì “kết nối với nhiều bên khác nhau”, hãy chỉ cần thay đổi một dòng mã (như được chỉ định bởi base_url). Các công cụ như định tuyến (routing) và lưu trữ đệm (caching) là những công cụ miễn phí; hãy bắt đầu sử dụng chúng ngay.


Thông tin này có hữu ích không?

Hỗ trợ kỹ thuậtHỗ trợ trực tuyến
侧栏
Về đầu trang
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR