Eu cortei a conta da API do LLM em 70%: Notas de combate real do AirAi para roteamento + cache
0. Contexto: Como os custos com as contas aumentaram tanto?
Eu trabalho em alguns projetos paralelos (side projects) e, no início, ou tinha que gastar dinheiro para assinar o serviço oficial por 20 dólares por mês ou enfrentar a recusa dos cartões de crédito internacionais. No final do mês, ao fazer o balanço, descobri duas coisas muito desagradáveis:
80% das solicitações eram tarefas simples, como resumir, classificar e formatar dados, e usar o modelo mais caro era pura perda de dinheiro;
O custo da assinatura é fixo – quando há poucas solicitações, há prejuízo, e quando há muitas, o serviço não é suficiente.
Então, eu me virei para o AirAi: usei minha própria chave API, com cobrança por uso, e direcionei o cliente para sua interface compatível com o OpenAI.
Aqui também há um pequeno episódio. Eu nunca tive um cartão de crédito internacional decente; sempre que tentava fazer uma compra diretamente através das plataformas oficiais, era rejeitado. Por um tempo, usei o cartão de um parente, mas isso desencadeou um sistema de controle de risco e meu conta foi bloqueada. Levei quase duas semanas para resolver o problema. Depois disso, decidi procurar apenas métodos que não dependessem de cartões internacionais. O gateway que acabei usando aceita apenas USDT – o que, para alguém como eu que não tem um cartão internacional, é realmente o método com o menor custo de entrada: basta carregar a moeda e usar, sem mensalidades ou procedimentos de verificação de identidade (KYC). O mais importante é o preço: pelo que percebi, o custo unitário é cerca de 10% mais baixo do que o das compras diretas através das plataformas oficiais. Essa foi a verdadeira razão pela qual decidi usar esse serviço.
1. Troca de gateway em uma única linha: Aponte para qualquer gateway compatível
Quase todos os clientes que suportam endpoints personalizados (Claude Code, Cursor, Open WebUI, LibreChat, Cline…) podem ser configurados para usar um gateway diferente com apenas uma variável de ambiente, sem a necessidade de alterar o código. Basta apontar as duas variáveis abaixo para o seu próprio gateway:
export OPENAI_BASE_URL="https://api.airai.cc/v1" export ANTHROPIC_BASE_URL="https://api.airai.cc/v1"
Escolher qual gateway usar é outra questão; este artigo aborda apenas o método de implementação.
2. Prática de código: Roteamento + Cache
A simples troca de luz não é suficiente; o que realmente economiza dinheiro é “fazer o modelo certo fazer o trabalho certo + armazenar em cache solicitações repetidas”. Aqui está a estrutura que uso na produção (compatível com o OpenAI SDK); ambos os tokens base_url e api_key são lidos de variáveis de ambiente, e não estão definidos fixamente no código:
import openai, hashlib, os
client = openai.OpenAI(
base_url=os.getenv("OPENAI_BASE_URL"),
api_key=os.getenv("OPENAI_API_KEY"),
)
# Routing: small model for light tasks, flagship only for complex reasoning
CHEAP = "gpt-5.6-luna" # classification / summarization / formatting
STRONG = "gpt-5.6-sol" # only called for complex reasoning
_cache: dict[str, str] = {} # swap for Redis in production
def ask(prompt: str) -> str:
model = STRONG if len(prompt) > 400 else CHEAP
key = hashlib.md5(prompt.encode()).hexdigest()
if key in _cache: # cache hit, 0 cost
return _cache[key]
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
answer = resp.choices[0].message.content
_cache[key] = answer
return answerAjuste os parâmetros CHEAP e STRONG de acordo com o seu orçamento e os resultados desejados. O nome do modelo deve ser baseado na documentação do gateway que você está utilizando. Para tarefas off-line, lembre-se de usar a interface Batch, o que geralmente permite economizar mais da metade dos custos.
3. Comparação de custos (ilustrativa)
Antes e depois da reformaIlustraçãoDados (os números reais devem corresponder aos seus contas):
Projeto | Assinatura oficial / Conexão direta | AirAi + Cache de roteamento |
Modo de cobrança | Taxa mensal fixa / Preço oficial | Pagamento por uso |
Modelo leve | Modelo topo de linha (mais dispendioso) | Pequenos modelos (mais baratos) |
Pedidos repetidos | Recalculação do preço total | Hit de cache: custo zero |
Custo de experiência do usuário | Referência: 100% | Cerca de 10–30% (dependendo do volume de solicitações) |
4. Fronteiras de honestidade (vamos falar a verdade)
Nem todos economizam mais: Quando o volume mensal de solicitações é muito baixo, uma assinatura fixa pode ser mais vantajosa; o pagamento por uso pode ser mais vantajoso quando o volume de solicitações é alto. Calcule primeiro o seu próprio volume de solicitações.
Latência e estabilidade: Adicionar mais um gateway pode causar um pouco de atraso, especialmente em caminhos críticos, com possíveis timeouts e degradações no desempenho.
Segurança das chaves: Armazene as chaves em variáveis de ambiente, não as escreva diretamente no front-end ou em repositórios públicos.
5. Resumo
A essência da redução de custos com LLMs (Large Language Models) pode ser resumida em uma frase: usar modelos baratos para a maioria do trabalho, chamar os modelos mais caros apenas quando necessário e eliminar o desperdício de recursos (tokens); em vez de “conectar com N empresas”, basta alterar uma única linha de código (base_url). Roteamento e cache são recursos gratuitos; vamos começar usando-os.
Link do artigo:https://airai.cc/pt/ai-news/48/
Isso foi útil?