Menú

Reducimos la tasa de errores en las solicitudes de temporada promocional al 0.2% gracias a GPT-4 Turbo; evita cometer estos 3 errores.

Durante la promoción del Black Friday del mes pasado, nuestro pequeño equipo de tres personas dedicado al transporte transfronterizo en Europa no tuvimos que pasar la noche entera trabajando debido a solicitudes de verificación de direcciones de clientes, como había sucedido en ocasiones anteriores.

El año pasado todavía estábamos utilizando el GPT-4 convencional para la estandarización de direcciones; durante los períodos de mayor actividad, el 13% de las solicitudes devolvían un error 429, y solo el manejo de las quejas de los clientes llevó 36 horas. Este año, al cambiar a GPT-4 Turbo, no se ha activado ni una sola vez el límite de uso, y la tasa de errores se ha reducido significativamente.0.2%。

Primero, ¿qué es exactamente GPT-4 Turbo?

En resumen, OpenAI ha creado una versión de GPT-4 con mayor capacidad de procesamiento (mejor rendimiento), basada en la tecnología original de GPT-4. El parámetro clave que define esta mejora es...La cantidad de solicitudes que puede soportar una sola cuenta por minuto es 6 veces mayor que la del GPT-4 ordinario.Al mismo tiempo, el costo por token se ha reducido a la mitad, lo que representa una optimización específica para escenarios de alta concurrencia.

3 beneficios reales para los equipos técnicos pequeños y medianos

Lo primero y más directo es que ya no tenemos que preocuparnos por el control de la carga de trabajo. Tenemos una media diaria de 500,000 solicitudes de resolución de direcciones, y antes teníamos que utilizar tres modelos grandes de diferentes plataformas para realizar el equilibrio de carga. Solo para adaptar los gateways, escribimos más de 1000 líneas de código. Ahora, con solo conectar GPT-4 Turbo, podemos soportar el triple de tráfico pico durante la temporada de promociones.

El segundo punto es la alta eficiencia en el procesamiento de textos largos. A menudo tenemos que introducir toda una página de declaraciones aduaneras transfronterizas para extraer información, y antes el modelo GPT-4 solía dividir la solicitud en tres partes debido a la insuficiencia de contexto. Ahora, podemos procesarlo todo de una vez, lo que reduce el tiempo necesario para cada tarea en dos tercios.

El tercero es que realmente ahorramos en costos. Hicimos el cálculo de la cuenta del mes pasado y vimos que, para la misma cantidad de solicitudes, el costo de GPT-4 Turbo es solo el 28% del costo del anterior sistema de combinación de múltiples modelos. El dinero que ahorramos se utilizó para aumentar el salario del equipo durante dos meses.

No solo mires los beneficios, estos 3 problemas los hemos experimentado nosotros mismos.

Blue and yellow shipping containers aligned on a sandy beach with the ocean and sky in the background.

El primer problema es que las tareas de baja complejidad pueden no ser tan rentables como se pensaba. Al principio, redirigimos todas las solicitudes de verificación de direcciones, pero luego descubrimos que para tareas simples como determinar si una dirección pertenece a la Unión Europea, usar GPT-4 Turbo resultaba tres veces más costoso que utilizar modelos más ligeros. Ahora hemos reorientado estas solicitudes a modelos más adecuados.

El segundo problema es que el tiempo de respuesta predeterminado es incluso ligeramente más largo que el del GPT-4 común. Al principio, notamos que algunas solicitudes tardaban más de 200 ms en ser procesadas, y luego descubrimos que, en el modo de alta capacidad de procesamiento, se da prioridad a evitar que las solicitudes sean rechazadas, en lugar de lograr una latencia mínima. Solucionamos este problema al configurar parámetros de baja latencia específicamente para las solicitudes de consulta del front end que requieren una respuesta rápida.

El tercer problema es que el control de permisos a nivel de detalle es más limitado. El GPT-4 común permite personalizar parámetros como la “temperatura” del modelo y el valor de “top_p” en un rango muy preciso, pero el rango de ajuste del GPT-4 Turbo se ha reducido significativamente. Por lo tanto, en escenarios donde es necesario controlar con precisión el estilo de la salida (como en el caso de los textos de notificación de aduanas que generamos para nuestros clientes), es mejor volver a utilizar la versión común del modelo.

¿Quién debería usarlo? ¿Y quién no necesita unirse a esta algarabía?

Si eres un equipo pequeño o mediano y cumplees con estas tres condiciones, simplemente avanza directamente:

  • Diariamente, se reciben más de 100,000 solicitudes de alta concurrencia de grandes modelos.
  • Con frecuencia es necesario trabajar con tareas de texto largo que superan los 8k de contexto.
  • Antes, a menudo era necesario realizar el equilibrio de carga entre modelos debido a las limitaciones de flujo de datos.

Si el volumen de solicitudes de tu equipo es inferior a 10,000 al día, o si se trata únicamente de tareas simples de clasificación y extracción de datos, no hay necesidad alguna de cambiar a un modelo más complejo; un modelo más ligero es más que suficiente y, además, es más económico.

2 consejos prácticos para comenzar

Durante la primera semana, no realicen el cambio completo de sistema de inmediato. Primero transfieran el 10% de las solicitudes de texto largo con alta concurrencia para una implementación en modo gris, y luego, basándose en los datos de monitoreo de esa semana, incrementen gradualmente la cantidad. El primer día, cambiamos el 30% del sistema y casi tuvimos problemas debido a la falta de adaptación de algunos parámetros, lo que causó errores en la extracción de algunos formularios de aduanas.

No es necesario preparar un contexto muy extenso de antemano; el contexto de 128k de GPT-4 Turbo es suficiente para la mayoría de las escenas a nivel empresarial. Hemos probado introducir todo un contrato de logística de 30 páginas para verificar sus cláusulas, y la tasa de precisión no difiere en absoluto entre el procesamiento completo y el procesamiento por partes.

Dos preguntas que la gente suele hacer con frecuencia

P: ¿Será que la calidad de la salida será peor que la del GPT-4 común?
A: Realizamos una prueba con un conjunto de datos de 1000 direcciones y la tasa de acierto fue del 98.7%, lo que no difiere mucho del 98.9% del GPT-4 común. Esto es más que suficiente para escenarios a nivel empresarial.

P: ¿Es necesario volver a realizar el proyecto de Prompt?
A: Reprodujimos directamente todos los prompts que habíamos escrito anteriormente para el GPT-4 común, sin hacer ningún ajuste, y el resultado de la salida cumplió completamente con nuestras expectativas.

¿Te ha resultado útil?

Soporte técnicoSoporte en línea
侧栏
Volver arriba
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR