Menú

Utilizamos o3-mini para generar 1.2 millones de solicitudes de descripción de productos, lo que nos ha permitido ahorrar un 62% en costos de inferencia.

El mes pasado, justo antes del Black Friday, nuestro servicio de generación de contenido estuvo a punto de colapsar: el modelo general que utilizábamos de repente aumentó un 20% en su precio y la tasa de limitación de solicitudes se redujo a la mitad. Durante el pico de pruebas, el 17% de las solicitudes recibió el error 429. El equipo de operaciones nos presionó para saber si podríamos entregar a tiempo las descripciones de los 12000 productos con descuento que teníamos que publicar ese día. Decidimos probar y reorientamos el 30% del tráfico hacia el sistema o3-mini, y no solo logramos sobrevivir a toda la promoción, sino que también los costos resultaron mucho más bajos de lo esperado.

Primero, hay que aclarar qué es exactamente o3-mini.

Es el modelo de razonamiento ligero que OpenAI acaba de lanzar en Q1 en 2026, que se centra en la generación de contenido estructurado y las tareas de razonamiento simple de baja latencia. La ventana de contexto máxima es de 128k, y el costo del token es solo 1 / 8 de GPT-4o.

Los 3 beneficios más concretos que hemos obtenido hasta ahora

Red traffic light set against a bright, cloudy sky. Perfect for themes of travel, technology, and safety.

  • Durante el Black Friday, se generaron 1.2 millones de solicitudes para descripciones de productos.El costo total de la inferencia ha disminuido un 62% en comparación con el uso anterior de GPT-4o.No se ha activado ni una sola vez el mecanismo de limitación de tráfico; incluso las solicitudes pico que llegaron una hora antes del inicio de la promoción fueron atendidas todas.
  • La mayoría de las solicitudes devuelven resultados en menos de 18 milisegundos. Anteriormente, con los grandes modelos, a veces había retrasos de varios cientos de milisegundos; hemos eliminado directamente los mensajes de espera para la carga del contenido en la parte frontal de la aplicación, y la tasa de conversión de usuarios ha aumentado en un 0.8 por ciento.
  • La capacidad de generación de múltiples idiomas incorporada no requiere que hagamos adaptaciones adicionales; la precisión de las descripciones en portugués y español para las páginas de Latinoamérica ha aumentado un 21% en comparación con los modelos pequeños que ajustábamos manualmente anteriormente, lo que elimina la necesidad de que el equipo de operaciones invierta tiempo en una segunda revisión.

No te apresures a realizar el cambio completo de sistema; ya hemos resuelto esos problemas.

A yellow traffic light showing red against a clear blue sky background.

No uses esa información para razonamientos complejos de recomendación de productos. Al principio, intentamos alimentarle con la secuencia de navegación de los usuarios para que generara textos de recomendación personalizados, pero en 3 de cada 10 ocasiones se producían errores de asociación; por ejemplo, se recomendaba un toldo para exteriores junto a una lámpara de acampar. Al final, decidimos volver a utilizar el modelo principal para generar las recomendaciones.

Además, si tu negocio necesita utilizar herramientas, actualmente solo soporta la llamada simultánea de un máximo de 3 herramientas. Si se excede este número, o bien algunas llamadas no se ejecutan o se devuelven errores en los parámetros. Hemos tenido varios problemas con la precisión de los precios cuando se realizaban más de 2 consultas de inventario. Ya hemos solucionado esto al redirigir automáticamente las llamadas a modelos generales si se supera el límite de 2 herramientas.

Quién está adecuado para usarlo, y quién no necesita ni siquiera tocarlo.

Si tu escenario de negocio implica la generación masiva de contenido estructurado, el reconocimiento simple de intenciones de los usuarios o la respuesta a preguntas frecuentes (FAQ), especialmente para pequeñas y medianas empresas que no disponen de recursos computacionales adicionales para ajustar modelos en detalle, o3-mini es definitivamente la opción más económica y conveniente.

Pero si necesitas realizar depuración de código complejo, razonamiento lógico en múltiples pasos o un análisis detallado de documentos extensos, es mejor elegir un modelo generalista. En ese caso, la precisión de la salida del o3-mini disminuirá significativamente, y además, te tomará más tiempo verificar los resultados.

2 consejos prácticos para quienes lo usan por primera vez

Abstract representation of a multimodal model with dots and lines on a white background.

Primero realizaremos una implementación gradual del tráfico durante 7 días, sin hacer el cambio de forma completa de inmediato. Al principio, transfirimos las etiquetas de productos no esenciales a la nueva versión durante 3 días para verificar que la tasa de errores estuviera dentro de los límites aceptables. Solo después de confirmarlo procedimos a implementar gradualmente las etiquetas esenciales de las descripciones de productos, para evitar problemas que pudieran afectar las operaciones en línea.

Se puede construir una capa de enrutamiento sencilla que clasifique las solicitudes según su complejidad: las solicitudes simples se dirigen a o3-mini, mientras que las más complejas se redirigen automáticamente al modelo más avanzado. De esta manera, se puede ahorrar costos sin afectar el rendimiento en escenarios complejos. Eso es exactamente lo que estamos haciendo ahora; el 90% de las solicitudes se procesa con o3-mini y el 10% restante con el modelo más avanzado, lo que ha reducido los costos en más de la mitad.

Problemas comuns

Pregunta: ¿Deberíamos hacer un ajuste fino (microajuste) al modelo o3-mini? Respuesta: Si tu escenario es para la generación de contenido general, no es necesario en absoluto; el rendimiento nativo ya es suficiente. Sin embargo, si se trata de un escenario con muchos términos específicos de la industria, podrías proporcionar cientos de ejemplos para realizar un microajuste. Después de hacerlo, la precisión de las descripciones de productos de automóviles aumentó un 14%, y el costo solo aumentó un 5%.

Pregunta: ¿Es segura la seguridad de los datos? Respuesta: Por defecto, no se utilizan datos ingresados por los usuarios para entrenar los modelos. Si tienes necesidades de cumplimiento con las regulaciones, puedes optar por una instancia dedicada, lo que incurre en un 30% más de coste, pero los datos quedarán completamente aislados, lo que es adecuado para el procesamiento de contenido relacionado con la privacidad de los usuarios.

¿Te ha resultado útil?

Soporte técnicoSoporte en línea
侧栏
Volver arriba
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR