Utilizando o1-mini para la predicción de la cadena de suministro: ahorramos un 62% en costos de inferencia, pero nos topamos con 2 problemas fatales.
El mes pasado, durante el Black Friday, nuestro equipo casi tuvo un gran problema.
Hasta ahora, se han utilizado grandes modelos para predecir las necesidades de almacenamiento y distribución en la región de Norteamérica. Durante el período de pico, más del 18% de las solicitudes devolvieron un código de error 429 durante tres días consecutivos, lo que causó un gran desorden en los planes de almacenamiento de la operación. Como resultado, los productos más vendidos en tres estados se entregaron con 48 horas de retraso.
La necesidad de cambiar de modelo se indicó directamente como P0 en ese momento; dedicamos 7 días para probar 4 alternativas y al final elegimos o1-mini. Han pasado 22 días desde entonces y todos los problemas se han resuelto, pero también hemos tropezado con inconvenientes de los que nadie nos había hablado de antemano.
Para aquellos que no lo han escuchado antes: ¿qué es exactamente o1-mini?
Es el modelo de inferencia ligero lanzado por OpenAI, que ha sido optimizado específicamente para mejorar la velocidad de procesamiento de tareas lógicas y computacionales.La capacidad de razonamiento básica difiere en un 8% o menos en comparación con los grandes modelos principales, y el costo por token es solo una séptima parte del costo de los modelos principales.。
Desde el principio, nuestro enfoque fue dirigido a esta diferencia de costos, ya que nuestra tarea de predicción requiere la inserción de más de 3000 tokens de datos históricos de pedidos, información meteorológica y días festivos en cada ejecución, y se ejecuta casi 20,000 veces al día.
Los 3 beneficios más evidentes los hemos obtenido de manera concreta.
- Lo primero es que el problema de la limitación de tráfico ha desaparecido por completo: el umbral de limitación de cuentas para o1-mini es 12 veces mayor que el del modelo que utilizábamos antes, y durante el pico del Black Friday no se ha registrado ni un solo caso de error 429; además, la salida de los planes por parte del equipo de operaciones ha sido sin ningún retraso.
- Los costos se han reducido significativamente: según los datos de las facturas de nuestro sistema, al ejecutar la misma tarea de predicción,El costo de la inferencia mensual ha disminuido de 12,000 dólares a 4,500 dólares.Con el dinero que ahorramos, agregamos directamente 3 puntos de datos en tiempo real para los almacenes.
- La velocidad es tan alta que permite realizar ajustes en tiempo real: los modelos anteriores tardaban más de 20 segundos en realizar una predicción, mientras que ahora la mayoría de las solicitudes se completan en menos de 15 milisegundos. Hemos cambiado la frecuencia de actualización de los datos de predicción de una vez al día a cada 2 horas, lo que ha resultado en una disminución directa del 4 por ciento en la tasa de falta de stock.
Pero hay dos problemas o “trampas” que casi nos hicieron tener que revertir todo de inmediato cuando los encontramos.

El primer problema es que su capacidad para manejar datos no estructurados es terriblemente deficiente.
En nuestras entradas anteriores, había algunas palabras clave de las discusiones de los usuarios en las redes sociales que utilizábamos como referencia para los cambios en la demanda. Resulta que o1-mini las consideró información no válida, lo que llevó a que los datos de predicción generados en los primeros 3 días fueran un 20% más bajos de lo que realmente se necesitaba. Afortunadamente, contábamos con un mecanismo de verificación cruzada, por lo que no procedimos a realizar el pedido de productos basándonos en esos datos.
Al final, solo nos queda ejecutar un pequeño modelo de análisis de texto por separado para procesar esta parte de los datos, convertirlos en puntuaciones estructuradas y luego alimentarlas a o1-mini, para así resolver el problema.
El segundo problema es que su manejo de múltiples idiomas tiene sesgos ocultos.
En nuestras predicciones para la región de Canadá, hay nombres de lugares y productos en francés. Por defecto, el sistema o1-mini asigna algunos de estos términos en francés a categorías similares en inglés, lo que resulta en que los valores de predicción para el equipo de esquí en la región de Quebec se reducen a la mitad. Más tarde, corrigimos este problema al agregar una regla que obliga a mantener el idioma original de los términos en los prompts. Curiosamente, este problema no se menciona en ningún documento oficial.
Quién debería usarlo y quién no, ya hemos marcado las diferencias para ti.
Si eres como nosotros, y lo que haces es...Razonamiento lógico, cálculo numérico, toma de decisiones basada en reglasPara tareas que involucran una gran cantidad de datos, altos requisitos de costos y concurrencia, el nivel de rendimiento de o1-mini es prácticamente garantizado sin necesidad de preocupaciones adicionales.
Pero si lo que quieres hacer es generar contenido, comprender información de múltiples modalidades o manejar datos en varios idiomas de manera compleja, mejor no te involucres; los resultados pueden ser llenos de errores inesperados, y el costo de solucionarlos superará con creces el ahorro que esperabas obtener.
Dos consejos específicos para quienes empiezan por primera vez
Primero, antes de lanzar el producto, es esencial realizar una verificación paralela durante al menos 7 días; no procedas a transferir el tráfico de manera inmediata.
Al principio, queríamos ahorrarnos trabajo y solo lo probamos durante 3 días, y por suerte no nos encontramos con situaciones que requerían la entrada de texto en francés, lo que casi nos causó un gran problema. Un ciclo de 7 días es suficiente para cubrir la mayoría de las situaciones marginales en tu negocio.
En segundo lugar, no cambies los parámetros de temperatura de manera arbitraria.
Al principio, queríamos que el resultado fuera más flexible, así que ajustamos la temperatura a 0.7, pero los datos de predicción resultantes eran tan inestables que no se podían utilizar. Después de volver al rango oficialmente recomendado de 0.1 a 0.3, se estabilizaron. La función de este sistema es realizar inferencias determinísticas; si necesitas creatividad, es mejor utilizar modelos más grandes directamente.
Para terminar, aquí está una pregunta que muchas personas hacen con frecuencia: ¿Deberíamos esperar a la próxima versión?
Al menos en el escenario de la predicción de la cadena de suministro, la versión actual de o1-mini ya es suficiente. Hemos calculado que, incluso si la próxima generación fuera un 20% más barata, no compensaría el ahorro de mano de obra y los costos de fallos que estamos obteniendo con su uso actual. Cuanto antes la utilicemos, más rápido ganaremos.
Enlace del artículo:https://airai.cc/es/ai-news/36/
¿Te ha resultado útil?