Menú

Utilizamos GPT-4o para aumentar la precisión del servicio de atención al cliente multimodal al 92%, pero nos hemos encontrado con tres problemas muy difíciles de resolver.

El mes pasado, nuestro equipo técnico de tres personas dedicado al comercio electrónico transfronterizo en el Sudeste Asiático trabajó durante tres días y noches para migrar el sistema de atención al cliente inteligente desde un antiguo modelo de texto grande a GPT-4o. Originalmente pensábamos que se trataba simplemente de agregar una función de reconocimiento de imágenes, pero los cambios que se produjeron fueron mucho mayores de lo esperado, y también encontramos varios problemas inesperados.

Para quienes no están familiarizados con esto, ¿qué es exactamente GPT-4o?

En esencia, se trata de un modelo de generación multimodal de OpenAI, y la diferencia más importante con sus versiones anteriores es...En una sola ronda se pueden procesar simultáneamente tres tipos de entradas: texto, imágenes y audio, sin la necesidad de dividir las solicitudes para llamar a modelos diferentes.No es necesario realizar ningún procesamiento previo del formato de entrada; los parámetros de la interfaz son casi un 60% menos que los necesarios para las llamadas combinadas.

¿Por qué precisamente en el año 2026 tenemos que cambiarlo?

Anteriormente, nuestro sistema de atención al cliente solo podía manejar consultas en texto. Cuando los usuarios enviaban fotos de productos dañados o entregados incorrectamente, era necesario convertir manualmente esas fotos en descripciones en texto antes de introducirlas en el modelo. Durante las promociones, solo este proceso bloqueaba casi el 20% de las solicitudes, lo que hizo que la tasa de quejas de los usuarios se duplicara. También probamos una solución que combinaba un modelo de reconocimiento de imágenes con un modelo de texto, pero la precisión era solo del 76%. Los costos de reembolso debido a errores en las solicitudes de servicio posventa eran incluso mayores que los costos del modelo en sí.

Los tres beneficios más evidentes superan con creces nuestras expectativas iniciales.

Chart displaying global export goods data, highlighting key countries and trends.

  • La tasa de procesamiento automático de las solicitudes de servicio posventa aumentó directamente del 47% al 92%. Los dos empleados de atención al cliente a tiempo parcial que se encargaban de transcribir imágenes fueron reasignados a tareas más complejas relacionadas con las quejas de los clientes, lo que permitió ahorrar casi 1800 dólares al mes en costos laborales.
  • La consulta de voz en dialecto enviada por el usuario ya no necesita pasar por una interfaz ASR independiente; se transmite directamente al modelo, el cual puede reconocerla y dar una respuesta. La mayoría de las solicitudes se completan en menos de 15 milisegundos, lo que significa que la velocidad general de respuesta ha aumentado en tres veces.
  • Al procesar la misma solicitud de postventa que incluye imágenes y texto, el consumo de tokens es un 32% menor en comparación con la llamada separada al modelo de reconocimiento de imágenes y al modelo de texto. Como resultado, el costo del modelo durante los picos de las promociones es incluso más bajo que antes.

No solo hay ventajas; estos 3 problemas ocultos nos causaron pérdidas reales cuando los experimentamos.

El primer problema es que el umbral de throttling para las solicitudes de entrada multimodal es mucho más estricto que para las solicitudes de texto puro. Justo el primer día de lanzamiento, coincidió con un evento de aniversario de una tienda en la región de Sudeste Asiático, y el 17% de las solicitudes que contenían imágenes recibieron un error 429, lo que hizo que los usuarios no pudieran ver ninguna respuesta y pensaran que el servicio de atención al cliente había fallado. Como resultado, ese día se recibieron más de 300 comentarios negativos. Más tarde, tuvimos que crear una cola de descarte separada para las solicitudes con imágenes, mostrando un mensaje de “La imagen ha sido recibida, se está procesando” durante los períodos de mayor carga, lo que finalmente resolvió el problema.

El segundo problema es que la precisión del reconocimiento de texto en imágenes en idiomas no ingleses no es tan alta como se promueve. Nos encontramos con casos en los que usuarios enviaron etiquetas de envíos manuscritas en indonesio, y el modelo identificó incorrectamente 3 caracteres de la dirección, lo que resultó en que se proporcionó al usuario una dirección de devolución o reemplazo errónea, con lo que perdimos casi 200 dólares en costos de envío. Ahora, hemos añadido una capa adicional de interfaz OCR local para verificar el reconocimiento de imágenes en idiomas no ingleses, lo que ha reducido la tasa de errores a un nivel aceptable.

El tercer problema es que las reglas de conteo de tokens para la salida multimodal son completamente diferentes de las del texto puro, por lo que no puedes usar las fórmulas anteriores para estimar los costos. La primera semana que el sistema se puso en línea, no modificamos los umbrales de alerta de presupuesto, y los costos de un solo fin de semana superaron el 40% del presupuesto mensual. No nos dimos cuenta hasta que el departamento financiero nos lo notificó.

¿Deberíamos cambiarlo ahora? Hemos elaborado criterios claros para tomar la decisión.

Situaciones en las que puedes actuar de manera directa:

Smartphone displaying AI app with book on AI technology in background.

  • Tu negocio en sí mismo requiere el procesamiento simultáneo de dos o más tipos de entradas, incluyendo texto, imágenes y audio.
  • Ya se estaba utilizando la combinación de varios modelos para el procesamiento multimodal, pero el costo de integración era alto y la precisión no era suficiente.
  • Tus usuarios utilizan principalmente el inglés, o los idiomas principales que son bien soportados por GPT-4o son aquellos para los cuales el modelo tiene un buen nivel de capacidad de comprensión y generación de texto.

Situaciones en las que realmente no hay necesidad de gastar dinero:

  • Tu negocio solo tiene necesidades de procesamiento de texto puro, y el modelo anterior ya podía cumplir con los requisitos de precisión.
  • Tu negocio se dirige principalmente a mercados de lenguas minoritarias, involucrando la necesidad de reconocimiento de una gran cantidad de texto escrito a mano local y voz en dialectos locales.
  • Tu equipo no cuenta con personal adicional para desarrollar estrategias de degradación ni sistemas de monitoreo de costos.

2 consejos prácticos para los equipos que están pensando en empezar

Primero, antes de lanzar el servicio, ejecuta el tráfico de prueba durante 7 días; no transfieras el 100% de las solicitudes de inmediato. Envía las solicitudes de los usuarios reales tanto a tu sistema original como a GPT-4o y compara la precisión y los costos de ambos para asegurarte de que cumplan con tus expectativas antes de realizar la transición gradual del tráfico. Fue precisamente porque no seguimos este paso que sufrimos una gran pérdida.

En segundo lugar, establece alarmas de presupuesto separadas para las solicitudes multimodales, y puedes configurar el umbral al 120% de los costos estimados para evitar excesos de gastos.

Preguntas frecuentes

Pregunta: ¿Deberíamos esperar a que salga el próximo modelo antes de hacer el cambio?

Respuesta: Al menos en el escenario de la integración multimodal, la madurez actual de GPT-4o es suficiente para resolver problemas prácticos. La próxima generación de modelos aún tardará al menos un año en estar lista, por lo que no hay necesidad de desperdiciar los costos que se pueden ahorrar ahora por una actualización incierta.

P: ¿Cuál es la relación calidad-precio en comparación con los modelos multimodales open source?

Si tu equipo tiene la capacidad de ajustar y desplegar modelos open source por sí mismo, y además las exigencias de privacidad de los datos son altas, entonces los modelos open source son más económicos. De lo contrario, el costo de utilizar directamente GPT-4o es mucho más bajo que el costo de instalar y mantener servidores por tu cuenta.

¿Te ha resultado útil?

Soporte técnicoSoporte en línea
侧栏
Volver arriba
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR