Menú

Nuestro equipo trasladó el reconocimiento de direcciones al modelo GPT-5, lo que redujo el error 429 del 13% al 0.2%, pero encontramos dos problemas inesperados.

El mes pasado, la gran promoción de Black Friday acaba de terminar, y nuestros tres desarrolladores de backend estuvimos vigilando las pantallas de monitoreo durante un total de 72 horas. El año pasado, durante la gran promoción, el 13% de las solicitudes de resolución de direcciones sufrieron el problema del límite de 429; este año, finalmente, ese problema no se ha vuelto a presentar. El único ajuste clave que hicimos fue reemplazar todos los modelos generales que utilizábamos anteriormente por GPT-5 para el procesamiento estructurado de direcciones.

Para aquellos que no lo han probado, déjenme aclarar qué es GPT-5 en escenarios como el nuestro.

Es el gran modelo multimodal actualizado por OpenAI este año, y el único parámetro anclaje que nos resulta más útil es:El límite máximo de solicitudes de procesamiento estructurado por cuenta y por minuto es 12 veces mayor que el del modelo anterior.Además, la tasa de reconocimiento de entradas no estándar ha aumentado significativamente.

Nos dedicamos al transporte transfronterizo en Europa y procesamos 500,000 direcciones proporcionadas por usuarios cada día. Muchas personas mezclan calles, códigos postales y ciudades, e incluso agregan emojis o escriben erróneamente la mitad de la información. Los modelos anteriores o bien no reconocían correctamente la información o requerían tres llamadas a interfaces para obtener un resultado. Cuando aumenta el tráfico durante las promociones, el sistema se bloquea inmediatamente debido a las limitaciones de capacidad.

Después de pasar a GPT-5, los tres beneficios reales que hemos obtenido son...

Lo primero que es más obvio: el problema de la limitación de tráfico se resuelve directamente.Durante el pico de la promoción, la tasa de errores 429 disminuyó al 0.2%.Incluso no necesitamos agregar una cola de modelos de reserva, lo que ahorra el 30% del tiempo de operación que antes se dedicaba al equilibrio de carga.

El segundo punto es la mejora en la precisión del reconocimiento de direcciones: anteriormente, aproximadamente el 8% de las direcciones requerían una verificación manual adicional, mientras que ahora este porcentaje ha disminuido a menos del 1%. Como resultado, el equipo de atención al cliente tiene que manejar 2000 menos solicitudes de corrección de direcciones cada semana.

El tercero, por el contrario, no ha recibido mucha atención: permite cargar directamente fotos de formularios manuscritos para su reconocimiento, sin la necesidad de utilizar servicios de OCR adicionales para convertirlos en texto. Esto elimina dos pasos del proceso y la mayoría de las solicitudes reciben un resultado en menos de 15 segundos; solo en casos muy raros, donde las fotos están muy borrosas, el proceso puede demorarse un poco más.

No solo hay ventajas; es muy probable que también os encontréis con los dos problemas que hemos tenido que superar.

Detailed view of programming code in a dark theme on a computer screen.

El primer problema es que la adaptación de la ortografía de los dialectos de las regiones de lenguas minoritarias no es adecuada. Pensábamos que la capacidad multilingüe del sistema era lo suficientemente buena, pero resulta que la semana pasada la tasa de errores en el reconocimiento de direcciones en euskera en España aumentó repentinamente al 12%. Al investigar, descubrimos que había muy pocos ejemplos de direcciones en estos dialectos minoritarios en los datos de entrenamiento. Por lo tanto, ahora solo podemos aplicar reglas locales como solución temporal para estas direcciones.

El segundo problema es el costo. Anteriormente calculamos que el costo por token por solicitud solo era un 20% más alto que en la generación anterior, pero olvidamos que los campos estructurados que se devolvían por defecto eran 3 más que antes, lo que resultaba en un aumento real del costo por token del 40%. Más tarde, restringimos los campos devueltos en el prompt a solo los 5 necesarios, lo que nos permitió reducir el costo a un nivel un 10% más alto que antes.

¿Qué equipos deberían actuar de inmediato y cuáles no necesitan intervenir en absoluto?

  • Se necesita: Más de 100,000 solicitudes diarias de procesamiento estructurado de texto e imágenes no estandarizados. Para los equipos que anteriormente se han visto afectados por la limitación de velocidad de los modelos y la insuficiente precisión, como las pequeñas y medianas empresas que trabajan en comercio electrónico, logística o manejo de tickets de servicio al cliente, el ROI (Retorno de Inversión) será muy evidente después de hacer el cambio.
  • Lo que no debería usarse: Solo para hacer preguntas y respuestas simples, generar contenido, o para equipos con menos de 10,000 solicitudes diarias, no hay necesidad alguna de gastar ese dinero. El modelo anterior es más que suficiente y, de hecho, puede ahorrar bastante dinero.

Dos consejos específicos para quienes se inician por primera vez

Primero, utiliza los datos de las solicitudes reales de los últimos 7 días como conjunto de prueba. No te limites solo a los ejemplos proporcionados por las autoridades, especialmente aquellos relacionados con idiomas minoritarios o regiones poco comunes. Es esencial ejecutar la prueba primero para verificar la precisión del sistema, ya que descubrir errores de clasificación después de la implementación podría causar muchos problemas.

En segundo lugar, la primera vez que hagas la llamada, debes especificar directamente en el prompt los campos de retorno que necesitas; no dejes que el sistema genere contenido de forma automática, ya que eso podría generar un consumo innecesario de tokens.

Alguien pregunta: ¿Todavía es necesario hacer cola para solicitar acceso a GPT-5 en estos días?

Somos cuentas de desarrolladores empresariales; los permisos se otorgan 3 días después de enviar la documentación necesaria. Los desarrolladores individuales pueden tener que esperar de 1 a 2 semanas. Sin embargo, en casos de urgencia, se puede utilizar el canal verde para empresas, lo que permite activar la cuenta en el mismo día.

¿Te ha resultado útil?

Soporte técnicoSoporte en línea
侧栏
Volver arriba
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR