Menu

Nous avons utilisé GPT-4o pour améliorer la précision du service client multimodal à 92 %, mais nous avons rencontré trois problèmes particulièrement difficiles à surmonter.

Le mois dernier, notre équipe technique de trois personnes spécialisée dans le e-commerce transfrontalier en Asie du Sud-Est a travaillé pendant trois jours et trois nuits pour passer le système de service client intelligent d'un ancien modèle de grande taille basé sur du texte à GPT-4o. Nous pensions qu'il s'agissait simplement d'ajouter une fonction de reconnaissance d'images, mais les changements apportés ont été bien plus importants que nous le prévoyions, et nous avons rencontré de nombreux problèmes inattendus.

Pour ceux qui ne sont pas familiers avec le sujet, expliquons clairement : qu’est-ce que le GPT-4o ?

L'essence est que c'est un modèle de génération multimodal d'OpenAI, et la différence la plus significative par rapport aux versions précédentes est...Une seule itération peut traiter simultanément des entrées de type texte, image et audio, sans la nécessité de diviser les demandes pour appeler différents modèles.Sans avoir à effectuer de prétraitement du format d'entrée vous-même, les paramètres d'interface sont réduits de près de 60 % par rapport aux appels combinés.

Pourquoi devons-nous le changer précisément en 2026 ?

Auparavant, notre système de service client ne pouvait gérer que les consultations textuelles. Lorsque les utilisateurs envoyaient des photos de produits endommagés ou de livraisons erronées, il fallait d'abord convertir ces photos en descriptions textuelles manuellement avant de les fournir au modèle. Pendant les périodes de promotions, cette étape bloquait près de 20 % des demandes d'assistance, ce qui a doublé le taux de plaintes des utilisateurs. Nous avons également essayé une solution combinant un modèle de reconnaissance d'images et un modèle de traitement du texte, mais avec un taux de précision de seulement 76 %. Les pertes dues aux erreurs de jugement dans les demandes d'après-vente étaient même supérieures aux coûts du modèle lui-même.

Les trois bénéfices les plus évidents dépassent complètement nos attentes initiales.

Chart displaying global export goods data, highlighting key countries and trends.

  • Le taux de traitement automatique des demandes d'après-vente est passé directement de 47 % à 92 %. Les deux agents de service client à temps partiel qui étaient auparavant chargés de la transcription des images ont été réaffectés à des tâches plus complexes liées aux plaintes des clients, ce qui a permis d'économiser près de 1800 dollars par mois en coûts de main-d'œuvre.
  • Les consultations vocales en dialecte envoyées par les utilisateurs n’ont plus besoin d’utiliser une interface ASR (Automatic Speech Recognition) indépendante ; elles peuvent être directement transmises au modèle, qui les reconnaît et fournit une réponse. La plupart des demandes sont traitées en moins de 15 millisecondes, ce qui représente une accélération de la vitesse de réponse globale de trois fois.
  • Lors du traitement d'une même demande d'après-vente contenant à la fois des images et du texte, la consommation de tokens a été réduite de 32 % par rapport à l'appel séparé des modèles d'identification d'images et de reconnaissance de texte. En conséquence, le coût des modèles pendant les périodes de forte promotion est même plus bas qu'auparavant.

Ne vous contentez pas de regarder les avantages ; ces 3 pièges cachés nous ont coûté de vrais pertes lorsqu’on les a rencontrés.

Le premier problème est que le seuil de limitation des entrées multimodales est beaucoup plus strict que pour les demandes de texte pur. Le premier jour de mise en ligne, nous avons justement rencontré une activité de fête d'anniversaire d'un site en Asie du Sud-Est, et 17 % des demandes contenant des images ont reçu une réponse d'erreur 429. Les utilisateurs, ne voyant aucune réponse, ont pensé que le service client était hors service, ce qui a entraîné plus de 300 avis négatifs ce jour-là. Par la suite, nous n'avons pas eu d'autre choix que d'ajouter une file d'attente dédiée aux demandes avec images, affichant d'abord le message "L'image a été reçue, en cours de traitement" pendant les périodes de pointe, ce qui a permis de résoudre le problème.

Le deuxième problème est que la précision de la reconnaissance des textes sur les images en langues non anglophones n’est pas aussi élevée que ce qui est promis. Nous avons rencontré le cas d’une commande manuscrite en indonésien envoyée par un utilisateur ; le modèle a mal reconnu trois caractères d’adresse, ce qui a entraîné l’envoi d’une adresse de retour et d’échange incorrecte, causant une perte de près de 200 dollars en frais de livraison. Désormais, nous avons ajouté une couche d’interface OCR locale pour la reconnaissance des images en langues non anglophones afin de vérifier les résultats, ce qui a permis de réduire le taux d’erreurs à un niveau acceptable.

Le troisième problème concerne les règles de comptage des tokens pour les sorties multimodales, qui sont complètement différentes de celles pour le texte pur. Il est donc impossible d'utiliser les formules précédentes pour estimer les coûts. La première semaine de lancement, nous n'avons pas modifié les seuils d'alerte budgétaires, et les dépenses d'un seul week-end ont dépassé de 40 % le budget mensuel. Ce n'est que lorsque le service financier nous a rappelé que nous nous en sommes rendu compte.

Faut-il vraiment le changer maintenant ? Nous avons établi des critères de décision clairs.

Dans les cas où vous pouvez agir directement :

Smartphone displaying AI app with book on AI technology in background.

  • Votre activité professionnelle nécessite de gérer simultanément deux types ou plus d'entrées, à savoir du texte, des images et de l'audio.
  • Nous utilisions déjà plusieurs modèles pour effectuer le traitement multimodal, mais cela impliquait des coûts élevés et une précision insuffisante.
  • Vos utilisateurs utilisent principalement l'anglais, ou les langues majeures sont celles pour lesquelles GPT-4o offre un soutien relativement complet.

Il n'y a absolument aucune raison pour que vous gaspilliez de l'argent dans ces cas :

  • Votre entreprise a uniquement des besoins de traitement de texte brut, et le modèle précédent était déjà capable de répondre aux exigences en termes de précision.
  • Votre activité cible principalement les marchés de langues minoritaires et implique la reconnaissance de grandes quantités de textes manuscrits locaux ainsi que de sons dialectaux.
  • Votre équipe ne dispose pas de ressources supplémentaires pour développer des stratégies de dégradation ni des outils de surveillance des coûts.

Deux conseils pratiques pour l'équipe qui s'apprête à commencer

Premièrement, avant de mettre le service en ligne, lancez un test avec un volume de trafic simulé pendant 7 jours. Ne passez pas directement à 100 % des demandes. Envoyez également les demandes des utilisateurs réels à votre système d’origine ainsi qu’à GPT-4o, et comparez les taux de précision et les coûts des deux solutions. Assurez-vous que les résultats correspondent à vos attentes avant de procéder progressivement au transfert du trafic. C’est exactement parce que nous n’avons pas suivi cette étape que nous avons subi de lourdes pertes.

Deuxièmement, il est possible de définir des alertes budgétaires spécifiques pour les demandes multimodales, en fixant un seuil à 120 % des coûts estimés, afin d'éviter tout dépassement des budgets.

Frequently Asked Questions

Question : Devrions-nous attendre la sortie du modèle de la prochaine génération avant de faire le changement ?

Réponse : Au moins dans le contexte de l'intégration multimodale, le niveau de maturité actuel de GPT-4o est suffisant pour résoudre les problèmes pratiques. Le prochain modèle ne sera prêt que dans plus d'un an, il n'est donc pas nécessaire de gaspiller les économies réalisées maintenant pour des mises à jour incertaines.

Question : Quelle est la relation de coût-efficacité par rapport aux modèles multimodaux open source ?

Si votre équipe a la capacité de personnaliser et de déployer des modèles open source, et que les exigences en matière de confidentialité des données sont élevées, alors les modèles open source sont plus avantageux. Dans le cas contraire, le coût de l'utilisation directe de GPT-4o est bien inférieur à celui de mettre en place et d'exploiter vos propres serveurs.

Cela vous a-t-il aidé ?

Support techniqueAssistance en ligne
侧栏
Haut de page
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR