Reducí la factura de la API LLM en un 70%: AirAi Real Battle Notes for Routing + Cache
0. Contexto: ¿Cómo se produjo el aumento de los costos de las facturas?
Estoy trabajando en varios proyectos secundarios (side projects) y, en las etapas iniciales, o bien tenía que pagar la suscripción oficial de $20 al mes, o bien enfrentaba rechazos en mis solicitudes de tarjeta de crédito internacional. Al final del mes, al hacer el cálculo, descubrí dos cosas desagradables:
El 80% de las solicitudes eran tareas sencillas como resumen, clasificación y formato; usar el modelo más caro para estas tareas era simplemente un desperdicio;
La suscripción es un costo fijo: cuando se realizan pocas llamadas, resulta en pérdidas, y cuando se realizan muchas, no es suficiente.
Así que me volví a AirAi: tomé la clave API, cobré por volumen y apunté al cliente a su interfaz compatible con OpenAI.
Aquí también hay un pequeño incidente. Siempre he tenido problemas para usar tarjetas de crédito internacionales decentes; cada vez que llegaba el momento de pagar, la transacción era rechazada. Durante un tiempo, usé la tarjeta de un familiar, pero eso desencadenó una revisión de riesgos y mi cuenta fue bloqueada. Tuve que presentar una queja y esperar casi dos semanas para que se desbloqueara. Después de eso, decidí buscar alternativas que no dependieran de tarjetas internacionales. El gateway que finalmente elegí solo acepta USDT, lo que para alguien como yo, que no tiene tarjeta internacional, es la opción con menos requisitos: se puede cargar dinero y usarlo de inmediato, sin necesidad de pagar una tarifa mensual ni pasar por un proceso de verificación de identidad (KYC). Lo más importante es el precio: según mis cálculos, el costo unitario es aproximadamente la mitad del que cobra la conexión directa con los servicios oficiales. Esa fue la razón principal por la que decidí usarlo.
1. Cambio de línea: Dirige a cualquier gateway compatible.
Casi todos los clientes que soportan puntos de terminación personalizados (Claude Code, Cursor, Open WebUI, LibreChat, Cline, etc.) pueden cambiarse con una sola variable de entorno, sin necesidad de modificar el código. Solo necesitas dirigir las siguientes dos variables a tu propio gateway:
export OPENAI_BASE_URL="https://api.airai.cc/v1" export ANTHROPIC_BASE_URL="https://api.airai.cc/v1"
Elegir qué gateway utilizar es otro asunto; este artículo solo trata sobre los métodos de implementación.
2. Práctica de código: Rutas + Caché
No es suficiente solo con cambiar la luz; lo que realmente ahorra dinero es “hacer que el modelo correcto haga el trabajo correcto + cachear las solicitudes repetidas”. A continuación, te muestro el esqueleto que uso en la producción (compatible con el SDK de OpenAI). Tanto base_url como api_key se obtienen de variables de entorno, y no están escritos fijamente en el código:
import openai, hashlib, os
client = openai.OpenAI(
base_url=os.getenv("OPENAI_BASE_URL"),
api_key=os.getenv("OPENAI_API_KEY"),
)
# Routing: small model for light tasks, flagship only for complex reasoning
CHEAP = "gpt-5.6-luna" # classification / summarization / formatting
STRONG = "gpt-5.6-sol" # only called for complex reasoning
_cache: dict[str, str] = {} # swap for Redis in production
def ask(prompt: str) -> str:
model = STRONG if len(prompt) > 400 else CHEAP
key = hashlib.md5(prompt.encode()).hexdigest()
if key in _cache: # cache hit, 0 cost
return _cache[key]
resp = client.chat.completions.create(
model=model,
messages=[{"role": "user", "content": prompt}],
)
answer = resp.choices[0].message.content
_cache[key] = answer
return answerAjusta los parámetros CHEAP y STRONG de acuerdo con tu presupuesto y los resultados deseados. El nombre del modelo debe seguir las instrucciones del documento del gateway que estés utilizando. Recuerda utilizar la interfaz Batch para las tareas en línea, ya que generalmente puedes ahorrar la mitad de los costos.
3. Comparación de costos (esquemática)
Antes y después de la modificaciónEsquemaDatos (los números reales deben corresponder a tus facturas):
Proyecto | Suscripción oficial / Conexión directa | AirAi + Caché de enrutamiento |
Modo de facturación | Tarifa mensual fija / Precio oficial | Facturación por uso |
Modelo para tareas ligeras | Modelo de alta gama (más costoso) | Pequeños modelos (más económicos) |
Solicitudes repetidas | Recálculo del precio completo | Acceso a caché: 0 costos |
Costo de experiencia del usuario | Referencia: 100% | Alrededor del 10–30% (dependiendo del volumen de solicitudes) |
4. Límites de honestidad (hablemos claro)
No todos ahorran dinero: Cuando el volumen mensual de solicitudes es muy bajo, una suscripción fija puede ser más económica; el pago por uso resulta más ventajoso cuando el volumen de solicitudes es alto. Calcule primero su propio volumen de uso.
Retraso y estabilidad: Agregar una capa adicional de gateway puede causar un ligero retraso, especialmente en las rutas clave, lo que puede llevar a tiempos de espera más largos y a situaciones de degradación del servicio.
Seguridad de las claves: Guarde las claves en variables de entorno, no las escriba de forma fija en el frontend ni en repositorios públicos.
5. Resumen
La esencia de ahorrar costos con los modelos LLM se puede resumir en una frase: hacer que los modelos más económicos realicen la mayor parte del trabajo, utilizar los más caros solo cuando sea necesario, y eliminar los tokens que no son necesarios; además, cambiar la tarea de "conectar con N empresas" a "modificar una sola línea de código" (base_url). Las rutas y la caché son dos herramientas gratuitas que podemos utilizar primero.
Enlace del artículo:https://airai.cc/es/ai-news/48/
¿Te ha resultado útil?