Notre équipe a réduit les coûts de résolution d'adresses de 62 % grâce à GPT-3.5, et en même temps, nous avons résolu le problème de la limitation du débit pendant les grandes promotions.
Lors de la promotion du Black Friday dernier, notre équipe de trois personnes travaillant sur le backend pour le transport de petits colis transfrontaliers aux Pays-Bas n’a pas passé la nuit entière à côté des serveurs, pour la première fois. L’année dernière à cette époque, le taux de précision de notre modèle de correction d’adresses maison n’était pas supérieur à 80 %, et il fallait désigner une personne spécialement pour surveiller les journaux d’erreurs 24 heures sur 24. Résultat : le taux de retours des colis dus à des adresses incorrectes atteignait 11 %.
Pour ceux qui ne sont pas familiers avec le sujet, expliquons simplement ce qu’est GPT-3.5 :
Il s'agit d'un grand modèle linguistique lancé par OpenAI en 2022, et qui est encore en cours de mise à jour en 2026. La version stable prend en charge une fenêtre de contexte allant jusqu'à 16 000 mots, et la vitesse de réponse aux demandes d'output structuré non en flux est généralement inférieure à 200 ms, ce qui le rend parfaitement adapté aux besoins de traitement sémantique léger et à haute concurrence en ligne.
Nous l'avons choisi pour résoudre les problèmes de résolution d'adresses, et cela présente trois avantages concrets.

- Premièrement, il y a le taux de précision immédiat à l'ouverture de l'application : il n'est pas nécessaire de marquer soi-même des millions d'adresses de différents pays pour l'entraînement. Nous n'avons utilisé que 200 exemples d'adresses anormales historiques pour un entraînement de type « few-shot », et le taux de précision de la résolution a immédiatement augmenté.98.7%Le taux de défauts a été réduit directement en dessous de 1 %.
- Deuxièmement, le coût est beaucoup plus bas que celui de la solution développée en interne : auparavant, le coût mensuel pour maintenir notre modèle et trois serveurs GPU s'élevait à 1200 euros. Aujourd'hui, en utilisant GPT-3.5 pour traiter 500 000 requêtes par jour, le coût mensuel n'est que de 450 euros, ce qui représente une réduction de 62 % des dépenses.
- Troisièmement, l'expansion de la capacité ne nécessite absolument aucune intervention de notre part : pendant la période du Black Friday, le volume de nos demandes a triplé. Auparavant, notre modèle développé en interne ne pouvait gérer qu'un maximum de 1,5 fois la charge normale avant de rencontrer des problèmes. Cette fois, nous avons simplement soumis une demande temporaire d'augmentation de la capacité à OpenAI à l'avance, et aucun erreur de type 429 n'a été signalée tout au long du processus.
Ne regardons pas que les avantages : les erreurs que nous avons commises au cours des trois derniers mois sont plus nombreuses que les bénéfices que nous avons obtenus.
Au début, nous avons simplement fourni les champs d'adresses originaux au modèle, ce qui a souvent entraîné des erreurs de reconnaissance, par exemple en confondant les adresses de villages et de petites villes en Europe avec celles de villes aux États-Unis. Après une semaine de travail, nous avons découvert que la règle de « priorité à la correspondance avec le champ du pays de destination inclus dans la demande de livraison » n'était pas incluse dans le Prompt par défaut.
Une autre fois, nous avons accidentellement activé la sortie en flux, ce qui a entraîné une augmentation de trois fois du temps de retour de tous les résultats de la analyse. Pendant la période de pointe, 20 000 demandes ont expiré en raison de temps d'attente excessif. Il a fallu plus d'une demi-journée pour découvrir que c'était à cause d'un collègue qui avait oublié de rétablir les paramètres corrects après les avoir modifiés.
Le problème le plus problématique était celui des factures : au début, nous n'avions pas mis en place de limitation de la longueur des entrées, et tous les commentaires inutiles que les utilisateurs ajoutaient lors de la saisie de leurs adresses étaient également transmis au modèle. À la fin du mois, la facture s'avérait 30 % plus élevée que prévu. Par la suite, nous avons introduit une règle de limitation de la longueur des entrées (100 caractères) et, dès le deuxième mois, les factures sont redevenues normales.
En fin de compte, GPT-3.5 n’est pas une panacée, et je vous conseille de ne pas vous précipiter pour rejoindre ces deux types d’équipes sans réfléchir.

Si votre équipe doit travailler avec des données à caractère hautement confidentiel, telles que des dossiers médicaux ou des informations de paiement, ne vous approchez pas de la version publique de GPT-3.5, peu importe à quel point elle est économique et pratique à utiliser. Vous ne pourriez pas vous permettre de prendre le risque de non-conformité des données.
Si votre besoin est de générer des documents professionnels de dizaines de milliers de mots ou de réaliser des raisonnements logiques complexes, il est préférable de choisir GPT-4o ou Claude 3. Le taux d'exactitude de GPT-3.5 dans de telles tâches est loin d'être satisfaisant, donc économiser un peu d'argent ne vaut pas la peine.
Inversement, si vous vous occupez de la classification des intentions des utilisateurs, de la correction d'erreurs dans de courts textes, de l'extraction d'informations structurées et autres tâches sémantiques légères, et que vous n'avez pas de besoins extrêmes en raisonnement, GPT-3.5 restera jusqu'en 2026 le choix le plus avantageux en termes de rapport qualité-prix, sans aucun doute.
Voici trois conseils pratiques pour ceux qui utilisent le produit pour la première fois, basés sur nos propres erreurs et difficultés rencontrées.
- Avant de mettre le service en ligne, lancez un test pendant 7 jours avec un trafic simulé : envoyez les demandes à la fois à votre solution actuelle et à GPT-3.5, et comparez uniquement les résultats sans affecter le trafic réel. Assurez-vous que le taux de précision et la vitesse répondent à vos attentes avant de procéder au remplacement complet.
- Apportez un filtre préliminaire à toutes les entrées : supprimez les espaces inutiles, les remarques superflues et les caractères spéciaux, ce qui peut permettre d'économiser au moins 20 % des ressources allouées aux tokens et de réduire les risques de fausses interprétations par le modèle.
- Il est essentiel de mettre en place une solution de rechange : au cas où l'interface OpenAI tomberait en panne, il faut disposer d'une alternative moins performante mais fiable, même si sa précision est inférieure, car c'est toujours mieux que de ne pas avoir de service du tout.
FAQ
Il est déjà 2026, il existe de nombreux nouveaux modèles, est-il encore nécessaire d'utiliser GPT-3.5 ?
C'est absolument nécessaire pour les tâches légères. Nous avons comparé avec des modèles open-source de même prix, et GPT-3.5 a une précision supérieure de au moins 5 points de pourcentage. De plus, il n'est pas nécessaire de s'occuper soi-même de son installation et de son maintien, ce qui réduit le coût total.
Faut-il s'inquiéter des limites de débit lors de l'appel ?
En général, tant que le trafic quotidien n'augmente pas soudainement de plus de 10 fois, la quantité de crédit allouée est suffisante. Il suffit de soumettre une demande de hausse de crédit 3 jours avant une promotion majeure. Nous avons déjà soumis trois demandes de ce type, et la réponse a été obtenue en seulement 2 heures dans les cas les plus rapides.
Lien de l’article :https://airai.cc/fr/ai-news/32/
Cela vous a-t-il aidé ?