Utiliser o1-mini pour la prévision de la chaîne d'approvisionnement : nous avons économisé 62 % des coûts de raisonnement, mais nous avons buté sur 2 problèmes mortels.
Le mois dernier, pendant la période de promotion Black Friday, notre équipe a failli échouer.
Jusqu'à présent, nous utilisions des grands modèles pour prédire les besoins de stockage et de livraison dans la région nord-américaine. Pendant la période de pointe, plus de 18 % des demandes ont été directement renvoyées avec le code d'erreur 429 pendant trois jours consécutifs, ce qui a provoqué des perturbations importantes dans le plan de réapprovisionnement de l'équipe opérationnelle. En conséquence, les produits les plus vendus dans trois États ont été livrés avec 48 heures de retard.
La demande de changement de modèle a été directement identifiée par la lettre P0. Nous avons passé 7 jours à tester 4 alternatives, et finalement nous avons retenu le modèle o1-mini. Depuis, il est en fonction depuis 22 jours, et tous les problèmes ont été résolus. Cependant, nous avons également rencontré des obstacles dont personne n’avait parlé à l’avance.
Pour ceux qui ne l’ont jamais entendu parler : qu’est-ce que l’o1-mini, au juste ?
Il s'agit du modèle de raisonnement léger lancé par OpenAI, qui a été spécialement optimisé pour accélérer le traitement des tâches logiques et calculatoires.Les capacités de raisonnement de base diffèrent de moins de 8 % par rapport aux grands modèles principaux, et le coût par token n’est que un septième de celui des modèles principaux.。
Nous avons commencé en nous concentrant sur cette différence de coût, car après tout, notre tâche de prédiction nécessite l'entrée de plus de 3000 tokens par commande historique, ainsi que des données sur le temps et les jours fériés, et cela se reproduit près de 20 000 fois par jour.
Les 3 bénéfices les plus évidents, nous les avons réellement obtenus.
- Tout d'abord, le problème de limitation de débit a complètement disparu : le seuil de limitation de débit par compte pour o1-mini est 12 fois supérieur à celui de notre modèle précédent, et même lors du pic des ventes du Black Friday, nous n'avons pas rencontré une seule fois de message d'erreur 429. Les données de planification de l'équipe opérationnelle affichent une latence nulle.
- Les coûts ont été réduits de manière significative : selon les données de nos factures internes, pour exécuter la même tâche de prédiction,Le coût de la réflexion mensuelle est passé de 12 000 dollars à 4 500 dollars.Nous avons utilisé l'argent économisé pour ajouter 3 points de données en temps réel pour les entrepôts.
- La vitesse est telle qu'il est possible de faire des ajustements en temps réel : les modèles précédents mettaient plus de 20 secondes pour effectuer une prédiction, tandis que maintenant la plupart des demandes sont traitées en moins de 15 millisecondes. Nous avons également modifié la fréquence de mise à jour des données de prédiction pour qu'elle se fasse toutes les 2 heures, au lieu d'une fois par jour. En conséquence, le taux de pénurie a chuté de 4 points de pourcentage.
Mais il y avait deux pièges, et nous avons failli devoir faire un rollback lorsqu’on les a rencontrés.

Le premier problème est que sa capacité à gérer les données non structurées est extrêmement faible.
Dans nos entrées précédentes, il y avait des mots-clés provenant des discussions des utilisateurs sur les réseaux sociaux, utilisés comme référence pour les fluctuations des demandes. Malheureusement, o1-mini a considéré ces informations comme non valables, ce qui a conduit à des prévisions pour les 3 premiers jours inférieures de 20 % par rapport à la demande réelle. Heureusement, nous disposons d'un mécanisme de vérification croisée, ce qui nous a permis d'éviter de commander des stocks inutilement.
En fin de compte, nous n'avons d'autre choix que de lancer un petit modèle d'analyse de texte séparément pour traiter cette partie de données, de la convertir en scores structurés, puis de les fournir à o1-mini afin de résoudre le problème.
Le deuxième problème est que son traitement multilingue présente des biais cachés.
Dans nos prévisions pour la région du Canada, il y a des noms de lieux et de produits en français. Par défaut, o1-mini mappe certains produits en français sur des catégories anglaises similaires, ce qui a entraîné une réduction de moitié des prévisions pour l'équipement de ski dans la région du Québec. Nous avons résolu ce problème en ajoutant une règle dans le prompt pour imposer le maintien de l'identifiant de la langue d'origine. Cependant, ce problème n'est pas mentionné du tout dans les documents officiels.
Qui devrait l'utiliser et qui ne devrait pas, nous avons tracé les lignes pour vous.
Si vous faites la même chose que nous,Raisonnement logique, calculs numériques, décisions basées sur des règlesPour une tâche qui nécessite une traduction de texte en français, avec une entrée principalement structurée, des exigences élevées en termes de coûts et de concurrence, le niveau de performance offert par o1-mini est considéré comme très bon, presque sans aucune hésitation.
Mais si vous vous occupez de génération de contenu, de compréhension multimodale ou de traitements linguistiques complexes, ne vous y aventurez pas : les résultats peuvent être pleins d'erreurs inattendues, et le coût de débogage sera supérieur à l'économie que vous pourriez réaliser.
Deux conseils concrets pour ceux qui commencent pour la première fois
Premièrement, avant le lancement, il est essentiel de réaliser au moins 7 jours de vérification parallèle avant de mettre en place le nouveau système, et il ne faut pas transférer directement le trafic vers le nouveau système.
Au début, nous avons voulu simplifier les choses et n’avons travaillé que pendant 3 jours, ce qui a coïncidé avec le fait que nous n’avons pas rencontré de scénarios impliquant l’entrée de texte en français, ce qui a failli causer de gros problèmes. Un cycle de 7 jours devrait couvrir la plupart des cas marginaux dans votre activité.
Deuxièmement, ne modifiez pas au hasard ses paramètres de température.
Au début, nous voulions rendre le résultat plus flexible en ajustant la température à 0,7, mais les données prédictives obtenues étaient trop instables pour être utilisables. Nous avons donc réglé la température de nouveau dans la plage recommandée par les autorités, soit de 0,1 à 0,3, et les résultats sont devenus stables. La fonction principale de cet outil est de réaliser des raisonnements déterministes ; si vous avez besoin de créativité, il est préférable d’utiliser directement des modèles plus puissants.
Pour conclure, voici une question que beaucoup de gens se posent : faut-il attendre la prochaine version ?
Au moins dans le contexte de la prévision de la chaîne d'approvisionnement, l'o1-mini actuel est déjà suffisant. Nous avons calculé que, même si la prochaine version coûtait 20 % de moins, cela ne compenserait pas les économies en main-d'œuvre et les coûts de pannes que nous réalisons actuellement. Plus nous l'utilisons tôt, plus nous gagnons.
Lien de l’article :https://airai.cc/fr/ai-news/36/
Cela vous a-t-il aidé ?