Menu

Nous avons réduit le taux d'erreurs des demandes pendant la saison des promotions à 0,2 % grâce à GPT-4 Turbo. Évitez de commettre ces 3 erreurs.

Lors de la promotion du Black Friday du mois dernier, notre petit équipe de trois personnes chargée du transport transfrontalier en Europe n’a pas été submergée de demandes de vérification d’adresses de la part des clients au point de devoir travailler toute la nuit pour la première fois.

L'année dernière, nous utilisions encore le GPT-4 standard pour la normalisation des adresses. Pendant les périodes de pointe, 13 % des demandes renvoyaient directement une erreur 429, et il nous a fallu 36 heures rien que pour gérer les plaintes des clients. Cette année, en passant au GPT-4 Turbo, nous n'avons pas rencontré une seule fois de limitation de débit, et le taux d'erreurs a été directement réduit.0.2%。

D'abord, il faut comprendre : qu'est-ce que GPT-4 Turbo exactement ?

En bref, OpenAI a développé une version à plus haute capacité de traitement de données basée sur GPT-4, dont le paramètre clé principal est l'ancrage.Le nombre de requêtes supportées par un seul compte par minute est six fois supérieur à celui du GPT-4 standard.En même temps, le coût par token a également été réduit de moitié, ce qui représente une optimisation conçue spécialement pour les scénarios à forte concurrence.

3 avantages réels pour les petites et moyennes équipes techniques

Le premier avantage le plus direct est de ne plus avoir à se soucier des problèmes de limitation de la charge. Nous recevons en moyenne 500 000 demandes d'analyse d'adresses par jour. Auparavant, nous devions utiliser trois grands modèles de différentes plateformes pour effectuer le load balancing, et nous avons écrit plus de 1000 lignes de code rien que pour l'adaptation aux gateways. Maintenant, avec GPT-4 Turbo seul, nous pouvons gérer le triple du trafic maximal pendant la saison des promotions.

Le deuxième avantage est l'efficacité élevée du traitement de textes longs. Nous devons souvent saisir toute une page de déclarations de douane transfrontalières pour effectuer l'extraction d'informations. Auparavant, le modèle GPT-4 classique avait tendance à diviser la tâche en trois demandes en raison d'un manque de contexte suffisant, mais maintenant, il peut tout traiter en une seule fois, réduisant ainsi le temps nécessaire pour une seule tâche de deux tiers.

Le troisième avantage est vraiment la réduction des coûts. Nous avons calculé les factures du mois dernier et avons constaté que, pour la même quantité de demandes, les dépenses liées à GPT-4 Turbo n’étaient que 28 % de celles du précédent système mixte à plusieurs modèles. L’argent économisé a été directement utilisé pour augmenter les primes du personnel de deux mois.

Ne vous contentez pas que des avantages : nous avons déjà rencontré ces 3 problèmes.

Blue and yellow shipping containers aligned on a sandy beach with the ocean and sky in the background.

Le premier problème est que les tâches à faible complexité peuvent en fait être moins rentables. Au début, nous avons dirigé toutes les demandes de vérification d'adresses vers ce processus, mais nous avons constaté que pour des tâches simples telles que déterminer si une adresse appartient à l'Union européenne, l'utilisation de GPT-4 Turbo coûtait trois fois plus cher que celle d'un modèle plus léger. Aujourd'hui, nous avons redirigé ces demandes vers des modèles plus appropriés.

Le deuxième problème est que la durée de réponse par défaut est légèrement plus longue que celle du GPT-4 standard. Lorsque nous avons fait le changement, nous avons constaté que certains requêtes mettaient plus de 200 ms à être traitées. Plus tard, nous avons découvert que, en mode haute capacité de traitement, la priorité était donnée à l'acceptation des requêtes plutôt qu'à une latence extrêmement faible. Nous avons résolu ce problème en activant des paramètres de faible latence spécifiquement pour les requêtes frontales qui nécessitaient une réponse rapide.

Le troisième inconvénient est la réduction des possibilités de contrôle granulaire des autorisations. Alors que le GPT-4 standard permet de personnaliser des paramètres tels que la “température” du modèle et le paramètre “top_p” dans une plage très précise, la gamme de réglage du GPT-4 Turbo est beaucoup plus restreinte. Pour les scénarios où il est nécessaire de contrôler avec précision le style de la sortie (par exemple, pour générer des textes de notifications de dédouanement pour nos clients), il est encore nécessaire de revenir à la version standard.

À qui cela est-il destiné ? Et à qui n’est-il pas nécessaire de se mêler à cette agitation ?

Si vous êtes une petite ou moyenne équipe et que vous répondez à ces trois conditions, allez-y directement :

  • Plus de 100 000 demandes simultanées par jour provenant de grands modèles.
  • Il est fréquent de devoir gérer des tâches de texte longues impliquant plus de 8 000 contextes.
  • Auparavant, il était fréquent de devoir effectuer un load balancing intermodèle en raison des restrictions de débit.

Si le volume de demandes de votre équipe est inférieur à 10 000 par jour, ou si ces demandes consistent uniquement en tâches simples de classification et d'extraction de données, il n'est absolument pas nécessaire de passer à un modèle plus complexe. Un modèle léger suffit et coûte moins cher.

Deux conseils pratiques pour débutants

Ne passez pas tout en une seule fois la première semaine ; commencez par transférer 10 % des demandes de texte longues et à forte concurrence pour une mise en œuvre progressive. Analysez les données de surveillance pendant une semaine avant d’augmenter progressivement la quantité. Le premier jour, nous avons transféré 30 % des demandes, et nous avons failli rencontrer des problèmes en raison de l’inadaptation des paramètres, ce qui a provoqué des erreurs dans l’extraction de certaines déclarations douanières.

Il n'est pas nécessaire de préparer un contexte trop long à l'avance, car le contexte de 128 Ko de GPT-4 Turbo est suffisant pour gérer la plupart des scénarios d'entreprise. Nous avons testé en fournissant tout le contenu d'un contrat logistique de 30 pages pour vérifier les clauses, et nous avons constaté qu'il n'y avait aucune différence entre la précision de l'output et le traitement par blocs.

Deux questions fréquemment posées

Q : La qualité de la sortie sera-t-elle inférieure à celle de GPT-4 standard ?
A : Nous avons testé 1000 exemples de validation d'adresses, avec un taux de précision de 98,7 %, ce qui est presque identique aux 98,9 % du GPT-4 standard. Cela est tout à fait suffisant pour les scénarios d'entreprise.

Q : Est-il nécessaire de refaire le projet Prompt ?
R : Nous avons simplement réutilisé tous les prompts que nous avions écrits précédemment pour le GPT-4 standard, sans aucun ajustement, et le résultat obtenu correspond parfaitement à nos attentes.

Cela vous a-t-il aidé ?

Support techniqueAssistance en ligne
侧栏
Haut de page
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR