Menú

Despliegue a nivel empresarial de puertas de enlace para la inferencia de LLM: redujimos el error 429 del 13% al 0 y también ahorramos un 28% en costos.

Durante la promoción del Black Friday del mes pasado, nuestro equipo técnico de comercio electrónico transfronterizo en Singapur estuvo trabajando en la sala de monitoreo durante 36 horas seguidas. Tres desarrolladores de backend se mantuvieron despiertos todo ese tiempo, observando atentamente la curva de tasa de éxito de las solicitudes. Casi saltamos de alegría al ver los resultados. El año pasado, en el mismo período promocional, tuvimos problemas debido a la limitación de tráfico impuesta por un único proveedor de LLM (Large Language Model).El 13% de las solicitudes de generación de descripciones de productos genera un error 429.El sistema administrativo del comerciante ha estado inactivo durante casi 4 horas, y ya hemos recibido más de 2000 quejas de los clientes.

Primero, hay que entender qué es un gateway de razonamiento de despliegue a nivel empresarial.

No se trata de un nuevo framework sofisticado; en esencia, es una capa de gestión de tráfico que actúa como intermediaria entre tus servicios empresariales y las interfaces de los distintos LLM (Large Language Models). Los parámetros clave son muy simples.Bajo una carga normal, el retraso en la programación no debe exceder los 10 ms.Si se excede, eso equivale a retrasar el progreso del negocio.

Tres beneficios reales que hemos obtenido después de haber resuelto los problemas:

Asian woman presenting a business infographic on global market trends in an office setting.

  • Lo primero que hicimos fue eliminar directamente el riesgo de limitación de tráfico: ahora recibimos solicitudes de tres de los principales proveedores de LLM (Large Language Models) al mismo tiempo, y el gateway distribuye automáticamente las solicitudes al nodo que tiene la cuota suficiente y responde más rápido. El pico de QPS durante el Black Friday de este año fue 2.3 veces mayor que el del año pasado, y en todo el proceso no hubo ni un solo caso de error tipo 429 (error de sobrecarga).
  • En segundo lugar, el costo disminuye de manera significativa: redirigimos las solicitudes de generación de etiquetas de productos de baja prioridad automáticamente a modelos más económicos y eficientes, sin necesidad de modificar el código del negocio. En solo 7 días, hemos ahorrado un 28% en los costos de tokens.
  • Lo último que se ha logrado es ahorrar el trabajo de repetición en el lado del servidor: antes, cada vez que se cambiaba de modelo o se agregaba un nuevo proveedor de servicios, era necesario modificar las interfaces de 3 módulos de negocio uno por uno. Ahora, todo se configura en la capa del gateway, y se puede resolver en medio día.

No solo hay ventajas; también hemos tropezado con estos 3 problemas de manera contundente.

Visual abstraction of neural networks in AI technology, featuring data flow and algorithms.

Durante la primera semana de lanzamiento ya tuvimos un incidente: después de activar la función de fallback automático, el gateway redirigió un grupo de solicitudes de contenido personalizado de alta prioridad que debían ser procesadas por GPT-4 a modelos más simples y de menor calidad, lo que resultó en que más de 200 anuncios de comerciantes no cumplieran con los requisitos. Como consecuencia, tuvimos que compensar con cupones promocionales por un valor de casi diez mil. Más tarde nos dimos cuenta de que no todas las solicitudes son adecuadas para ser redirigidas automáticamente a modelos menos potentes, y que en escenarios de alta sensibilidad es necesario implementar reglas de verificación adicionales como respaldo.

También hay muchos problemas de costos que no se han mencionado: si tu tasa de solicitudes por segundo (QPS) es inferior a 10 durante un largo período de tiempo, los costos de servidor y mantenimiento del propio gateway serán más altos que los de los paquetes de cuotas más avanzados de los proveedores de LLM (Modelos de Lenguaje Artificial). No tiene sentido forzar su uso.

Además, no te dejes engañar por esas promesas de “funcionalidad completa lista para usar desde el principio”. Probamos 3 gateways de código abierto, y las reglas de distribución de tráfico predeterminadas no se adaptaban en absoluto a los escenarios de comercio electrónico. Solo ajustar las reglas de ponderación nos llevó un día entero.

¿Quién debería ser el siguiente? ¿Quién realmente no necesita desperdiciar tiempo?

Directamente para juzgar los criterios, sin enredos:

  • Se puede considerar una de las siguientes situaciones: una cantidad diaria de solicitudes a los LLMs superior a 10,000, el uso de más de 2 modelos al mismo tiempo, o requisitos de disponibilidad del servicio superiores al 99.9%;
  • Si tu equipo es una pequeña startup de menos de 5 personas, tu negocio es esencial y no estás fuertemente vinculado al uso de grandes modelos, y el costo mensual de los LLMs no supera el salario de un ingeniero de backend, mejor no te preocupes por la implementación a nivel empresarial. Es más económico utilizar las interfaces nativas de los proveedores.

Dos sugerencias prácticas para principiantes

No realices el cambio completo de inmediato; primero utiliza el 10% del tráfico de baja prioridad durante una semana en modo de prueba (gris). Foca en dos indicadores clave: si ocurren solicitudes duplicadas y si la demora causada por la programación está realmente dentro de los límites aceptables. Nosotros comenzamos midiendo el tráfico de las respuestas automáticas postventa durante 3 días para asegurarnos de que no hubiera problemas antes de implementar el cambio en los servicios principales.

Pregunta: ¿Debo construir mi propio gateway desde cero? Respuesta: A menos que tu equipo tenga personas disponibles que no tengan nada que hacer, es mejor utilizar una versión open source ya desarrollada y modificada. Te ahorrarás al menos 2 meses de trabajo y disfrutarás de mayor estabilidad.

¿Te ha resultado útil?

Soporte técnicoSoporte en línea
侧栏
Volver arriba
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR