Menú

Aumentamos al máximo la precisión de la correspondencia de direcciones logísticas utilizando OpenAI o1, pero nos encontramos con 3 problemas inesperados.

Just después del pico del Black Friday de la semana pasada, nuestro equipo de backend de 3 personas en Europa finalmente pudo respirar aliviado: el año pasado, el 13% de las solicitudes de resolución de direcciones sufrió rechazos (error 429) debido a la limitación de un solo modelo. Este año, no solo no ha habido ningún caso de limitación, sino que la tasa de errores en la coincidencia de direcciones también ha disminuido un 82%. El cambio clave fue reemplazar nuestro modelo de inferencia principal por el o1.

Para quienes no están familiarizados con esto, ¿qué es exactamente el o1?

Se trata del gran modelo de aprendizaje automático reforzado por inferencia lanzado por OpenAI, que es diferente del anterior GPT-4o. Este nuevo modelo dedica más tiempo a “pensar” en problemas lógicos complejos, y según las pruebas oficiales de capacidad de inferencia, su puntuación ha aumentado en un 87% en comparación con GPT-4o. Fue precisamente este aspecto el que nos motivó a elegirlo desde el principio.

Para equipos pequeños y medianos como el nuestro, las ventajas de o1 son realmente significativas.

La primera ventaja resuelve directamente el problema más complicado para nosotros: la coincidencia de direcciones. Anteriormente, al usar GPT-4o, a menudo confundíamos calles con el mismo nombre y códigos postales de diferentes países en Europa, especialmente cuando los usuarios introducían direcciones con errores de ortografía. Teníamos que aplicar tres niveles de verificación de reglas para alcanzar un 92% de precisión, pero ahora o1 ha aumentado esa tasa a un 98.7%. Ya eliminamos todo ese código de reglas la semana pasada.

El segundo punto es que ya no es necesario realizar trabajos complejos de ingeniería de prompts. Anteriormente, para que el modelo generara resultados de análisis que se ajustaran al formato de nuestro backend, escribimos casi 2000 palabras de código para los prompts, y a menudo sucedía que el formato de salida se desviaba. Ahora, con solo una instrucción, todo se resuelve, lo que reduce el costo de mantenimiento de los prompts a cero.

El tercero punto es que la estabilidad de las solicitudes concurrentes es mejor de lo que esperábamos. Inicialmente temíamos que el largo tiempo de procesamiento de las solicitudes pudiera causar colas, pero los monitoreos muestran que la mayoría de las solicitudes se completan en menos de 15 milisegundos. Solo un número muy pequeño de consultas de direcciones internacionales, que son particularmente complejas, tardan más de 200 milisegundos, lo cual está completamente dentro de los límites aceptables para nosotros.

Pero sus trampas también pueden realmente dejarte completamente desamparado.

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

El primer problema es que el consumo de tokens es mucho mayor que en GPT-4o. En los primeros 3 días en que pasamos a usar GPT-4o, el costo de la inferencia aumentó directamente en un 2.300%. Más tarde descubrimos que o1 también incluía automáticamente su proceso de pensamiento en el consumo de tokens. Si no necesitas ver la lógica de su inferencia, debes desactivar la salida de ese proceso en los parámetros de llamada. Después de hacerlo, el costo volvió al nivel anterior, que era de 1.200%, lo cual es completamente aceptable.

El segundo problema es que no es adecuado para solicitudes simples y de alta frecuencia. Al principio, para simplificar las cosas, dirigimos todas las solicitudes de búsqueda de direcciones a o1, pero luego descubrimos que para aquellas direcciones que no tenían errores de ortografía ni formato estándar, no había diferencia en la precisión entre usar o1 y GPT-4o; además, incluso costaba más dinero. Ahora hemos añadido una verificación preliminar sencilla, de modo que solo las solicitudes que no cumplen con el formato estándar pasan por o1, lo que ha reducido los costos en un 30%.

El tercer problema es que el soporte para entradas en idiomas no latinos, como chino y árabe, no es lo suficientemente estable. Tenemos un pequeño número de usuarios en la región del Medio Oriente que, al introducir direcciones en árabe, a veces enfrentan errores de análisis. Después de informar este problema a OpenAI, todavía estamos esperando la corrección. Por el momento, seguimos utilizando reglas locales para realizar verificaciones adicionales.

¿Quién debería usar o1? ¿Quién no debe tocarlo ahora?

Si lo que tienes que manejar son tareas que requieren razonamiento lógico, como la coincidencia de reglas complejas, la verificación de múltiples condiciones o la generación de código simple, y ya has alcanzado un límite en la precisión al usar GPT-4o, entonces cambiar a o1 es una opción muy recomendable, ya que la relación entre la inversión y el resultado será muy favorable.

Pero si lo que haces es simplemente la clasificación de texto, la generación de contenido o solicitudes estandarizadas de alta frecuencia, entonces no hay necesidad en absoluto de usar o1; es una pérdida de dinero. GPT-4o e incluso GPT-3.5 pueden manejar esas tareas perfectamente.

2 consejos para quienes lo usan por primera vez

  • Primero, utiliza los 1000 datos históricos que procesaste con el modelo anterior para realizar una prueba. No realices el cambio de modelo de manera completa de inmediato; así podrás ver rápidamente si el aumento en la precisión compensa el aumento en los costos. En ese momento, llevamos a cabo la prueba durante 2 días y decidimos que era necesario cambiar el modelo.
  • Al realizar la llamada, se prefiere la versión o1-mini. Para el 90% de los escenarios de equipos pequeños y medianos, las capacidades de o1-mini son más que suficientes, y el precio es incluso un 60% más económico que la versión completa de o1.

Para terminar, vamos a responder a la pregunta que más gente hace: ¿será o1 reemplazado pronto por otros modelos? Al menos en el escenario de la resolución de direcciones que estamos trabajando, hemos probado todos los grandes modelos de inferencia disponibles en el mercado y ninguno ha superado la precisión de o1. Por lo menos en los próximos seis meses, seguirá siendo nuestra opción preferida.

¿Te ha resultado útil?

Soporte técnicoSoporte en línea
侧栏
Volver arriba
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR