Aumentamos la eficiencia en el manejo de las solicitudes de servicio postventa de los clientes tres veces utilizando Claude 3, pero nos topamos con dos problemas que no deberíamos haber tenido.
Cuando terminamos de generar los informes el pasado Viernes Negro, tres desarrolladores de nuestro equipo de SaaS para comercio electrónico en el Sudeste Asiático se quedaron atónitos al ver los datos del backend: los pedidos de servicio posventa que en años anteriores requerían que todo el equipo de atención al cliente trabajara sin parar durante tres días, este año se procesaron automáticamente en su mayoría, lo que llevó a una disminución directa del 42% en el número de quejas de los clientes. El único cambio clave fue reemplazar toda la lógica de reconocimiento semántico de los pedidos por Claude 3 Opus.
Para comenzar, diré algo honesto para aquellos que no tienen experiencia en esto:
Es el tercer modelo de lenguaje grande lanzado por Anthropic en 2024, y los parámetros clave que hemos utilizado son muy simples: con una ventana de contexto de alrededor de 200k y al procesar tickets de servicio posventa que incluyen 3 capturas de pantalla de productos, la tasa de precisión es un 18% más alta que la de los modelos de mismo nivel de parámetros que utilizábamos anteriormente.
Para un equipo pequeño como el nuestro, los tres beneficios son de gran valor económico.

Lo primero es que ya no es necesario realizar un procesamiento previo multimodal por separado. Anteriormente, para los imágenes de productos dañados y las capturas de pantalla de la logística que los usuarios subían, teníamos que utilizar un modelo OCR para convertir las imágenes en texto y luego combinar ese texto con los informes de servicio para alimentar al modelo principal. Solo el mantenimiento de esta cadena de procesamiento ya consumía la mitad de los recursos del servidor. Con la adopción de Claude 3, ahora podemos enviar las imágenes y el texto juntos, y los errores de reconocimiento han disminuido.
El segundo punto es que la tasa de rechazos es tan baja que prácticamente se puede ignorar. Los modelos anteriores, al encontrarse con solicitudes de usuarios escritas de manera muy confusa (por ejemplo, mezclando inglés y lenguaje local, junto con abreviaturas de internet), a menudo devolvían un mensaje indicando que no podían ser reconocidas y era necesario pasarlas a personal para su manejo. Hemos realizado estadísticas y en ese período, la proporción de casos que requerían intervención humana era del 27%; ahora, ese número es del 4%.
El tercero es que el costo de la llamada es mucho más bajo de lo que esperábamos. Pagamos según el uso real; en el pico del Black Friday, procesamos un promedio de 12,000 tickets diarios, y el costo total fue de menos de 800 dólares, lo que representa un ahorro del 90% en comparación con el costo de contratar a 10 empleados de atención al cliente temporales.
Pero no te apresures a actuar; los dos errores que cometimos son suficientes para que pierdas una semana entera en vano.
El primer problema fue el alineamiento de los textos en varios idiomas. La mitad de nuestros usuarios habla indonesio, y al lanzar el producto sin realizar ningún ajuste inicial, el modelo a menudo confundía expresiones lunfardas locales, por ejemplo, “enviar el producto en el color incorrecto” con “el usuario quiere cambiar la dirección de entrega”, lo que resultó en 17 quejas de clientes en una semana. Más tarde, después de proporcionar 3000 casos etiquetados de lenguaje local para el ajuste del modelo, el problema se resolvió.
El segundo problema es la pérdida de información en contextos largos. Si un ticket incluye más de 5 imágenes, el modelo a veces puede omitir información de alguna de ellas. Por ejemplo, si el usuario ha tomado fotos del daño en el empaque y del daño en el producto, el modelo solo puede detectar el problema con el empaque. Más tarde, agregamos una regla de verificación sencilla: si hay más de 3 imágenes, hacemos que el modelo genere los resultados de reconocimiento una por una antes de procesarlas de manera agregada, y desde entonces no hemos tenido más errores.
Para ser honesto, no todos los equipos son adecuados para usarlo.

Circunstancias en las que deberías usarlo:

- Tu negocio necesita manejar tanto texto como imágenes y audio corto al mismo tiempo, y no deseas establecer múltiples cadenas de modelos para ello.
- Requieres una alta precisión en los resultados, especialmente en escenarios donde el error puede tener costos elevados, como el manejo de tickets o la revisión de contratos.
- Tu equipo no cuenta con suficientes recursos humanos y no tiene la energía necesaria para mantener los complejos procesos de preprocesamiento de modelos.
Situaciones en las que no debes desperdiciar dinero:
- Solo necesitas realizar tareas sencillas como responder a preguntas con palabras clave o generar contenido de marketing; para eso, un modelo pequeño y económico es más que suficiente.
- Tus datos comerciales tienen requisitos estrictos de almacenamiento localizado, por lo que no es posible transferirlos a interfaces de modelos de terceros.
- Tu cantidad de solicitudes es especialmente baja, menos de 1000 al mes, por lo que el costo de desarrollo para cambiar de modelo es mayor que los beneficios.
Dos consejos prácticos para quienes empiezan por primera vez
El primero paso es realizar pruebas durante 7 días en escenarios periféricos antes de implementar la solución en los canales principales. Al principio, utilizamos los tickets históricos de los últimos 3 meses para realizar pruebas offline; solo cuando la tasa de precisión superó el 95%, comenzamos a transferir el 10% del tráfico en línea, y luego aumentamos gradualmente hasta que todo el tráfico estuvo bajo control. Durante todo este proceso, no ocurrieron incidentes graves en el entorno en línea.
El segundo punto es no elegir de inmediato la versión más cara de Opus. Hemos comprobado que, al tratar solicitudes de asistencia comunes sin imágenes, la precisión de la versión Sonnet es casi la misma que la de Opus (con una diferencia de menos del 2%), y el costo es solo la mitad, lo cual es más que suficiente.
Finalmente, vamos a responder a una pregunta que muchas personas hacen: ¿deberíamos esperar a la próxima generación de modelos? Nuestra respuesta es que si tu negocio ya está siendo afectado por la falta de eficiencia debido al procesamiento multimodal y a las bajas tasas de precisión, es mejor utilizar los modelos actuales. Después de todo, ahorrar costos laborales desde ahora mismo es mucho más valioso que esperar a que los modelos futuros reduzcan ligeramente los costos de llamada.
Enlace del artículo:https://airai.cc/es/ai-news/41/
¿Te ha resultado útil?