القائمة

لقد رفعنا دقة مطابقة عناوين الخدمات اللوجستية باستخدام OpenAI o1 إلى أقصى حد، لكننا واجهنا ثلاث مشكلات غير متوقعة.

بعد ذروة الجمعة السوداء في الأسبوع الماضي ، كان فريق الخلفية الأوروبي الثلاثة لدينا أخيرًا مرتاحًا: في العام الماضي ، كان هناك 13٪ من طلبات تحليل العنوان بسبب الحد من التيار المباشر لنموذج واحد إلى 429 ، وهذا العام لم يظهر فقط الحد من التيار ، وانخفض معدل الخطأ في مطابقة العنوان بنسبة 82٪.كان التغيير الأساسي هو أننا استبدلنا نموذج التفكير الرئيسي مع o1.

لنوضح الأمر لمن لم يسبق لهم التعرف عليه: ما هو بالضبط “o1”؟

هذا هو النموذج الكبير المعزز للتفكير الذي أطلقته شركة OpenAI، والذي يختلف عن GPT-4o السابق، حيث يقضي وقتًا أطول في “التفكير” في المشكلات المنطقية المعقدة. الدرجة التي حصل عليها في اختبار القدرات الأساسية للتفكير التي قدمتها الشركة الرسمية أعلى بنسبة 87% مقارنة بـ GPT-4o، وهذا هو السبب الذي جعلنا نختاره في البداية.

بالنسبة لفرقنا الصغيرة والمتوسطة الحجم مثلنا، فإن فائدة o1 حقيقية وواقعية.

الفائدة الأولى تعالج مباشرة مشاكل مطابقة العناوين الأكثر صداعًا.قبل استخدام GPT-4o ، غالبًا ما يتم الخلط بين الشوارع ذات الاسم والرمز البريدي المزدوج في البلدان الأوروبية المختلفة ، وخاصة العنوان الذي يدخل المستخدم مع أخطاء تهجئة ، يتطلب منا إضافة 3 طبقات من التحقق من القواعد حتى نصل إلى 92٪ من الدقة ، والآن سحب o1 مباشرة معدل الدقة إلى 98.7٪ ، وقد حذفنا جميعًا تلك القواعد الأسبوع الماضي.

والثاني هو عدم الحاجة للقيام بأعمال معقدة سريعة.في السابق من أجل جعل النموذج المخرج يتوافق مع نتائج تحليل تنسيق الخلفية لدينا، موجه كتب 2000 كلمة سريعة، وكثيرا ما يحدث أيضا تنسيق الإخراج الانحراف، والآن طالما يمكن أن يتم ذلك في سطر واحد من التعليمات، تكلفة الصيانة موجه انخفضت مباشرة إلى 0.

الثالث هو أن استقرار الطلبات المتزامنة أفضل مما كنا نتوقع. كنا قلقين من أن طول وقت المعالجة قد يؤدي إلى تكوين طوابير، لكن من خلال المراقبة، وجدنا أن معظم الطلبات تتم في غضون 15 مللي ثانية، وفقط عدد قليل جدًا من الاستعلامات المعقدة التي تشمل عناوين دولية تستغرق أكثر من 200 مللي ثانية، وهو أمر ضمن نطاق قابل للقبول تمامًا بالنسبة لنا.

لكن المخاطر المرتبطة به قد تفاجئك حقًا وتجعلك في موقف صعب.

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

الحفرة الأولى هي استهلاك توكن أعلى بكثير من GPT-4o.في الأيام الثلاثة الأولى التي قطعناها للتو ، ارتفعت تكلفة التفكير بشكل مباشر 2.3 مرة ، ثم اكتشف أن o1 سيحسب عملية التفكير تلقائيًا أيضًا في استهلاك الرمز المميز ، إذا كنت لا تحتاج إلى رؤية منطق التفكير ، فأنت متأكد من إيقاف تشغيل إخراج عملية التفكير في المعلمة ، ونحن نقوم بإيقاف تشغيل التكلفة مباشرة بعد انخفاضها إلى 1.2 مرة ، وهو مقبول تمامًا.

الحفرة الثانية ليست مناسبة لطلبات التردد العالي البسيطة.في البداية ، قمنا بقطع جميع طلبات الاستعلام عن العنوان إلى o1 بعد ذلك اكتشفنا أن العناوين التي لا توجد أخطاء امجائية تمامًا ، والتنسيق القياسي ، لا يوجد فرق بين o1 واستخدام GPT-4o في معدل الدقة ، بل إنفاق المزيد من المال ، والآن أضفنا فحصًا مسبقًا بسيطًا ، فقط الطلبات التي لا تتوافق مع الشكل القياسي ستذهب إلى o1 ، وانخفضت التكلفة بنسبة 30٪.

المشكلة الثالثة هي أن دعم المدخلات بلغات غير اللاتينية مثل الصينية والعربية ليس مستقرًا بما فيه الكفاية. لدينا عدد قليل من المستخدمين من منطقة الشرق الأوسط، وأحيانًا تحدث أخطاء في تحليل العناوين المدخلة باللغة العربية. بعد أن أبلغنا عن هذه المشكلة لشركة OpenAI، ما زلنا ننتظر التصحيح، وفي الوقت الحالي نقوم باستخدام القواعد المحلية لإجراء تحقق إضافي.

من يجب أن يستخدم o1؟ من لا يجب أن يلمسه الآن؟

إذا كنت تتعامل مع مهام تتطلب التفكير المنطقي، مثل مطابقة القواعد المعقدة، التحقق من الشروط المتعددة، أو إنشاء كود بسيط، وقد واجهت بالفعل حدودًا في دقة النتائج عند استخدام GPT-4o، فمن الأفضل التبديل إلى GPT-4o1 مباشرةً، حيث ستكون نسبة العائد إلى التكلفة مرتفعة للغاية.

لكن إذا كنت تقوم بتصنيف نصوص بسيط، أو إنشاء محتوى، أو معالجة طلبات موحدة بشكل متكرر، فلا حاجة على الإطلاق لاستخدام أداة o1؛ إنه مجرد هدر للمال، حيث يمكن لـ GPT-4o أو حتى GPT-3.5 أن تقوم بالمهمة بشكل ممتاز.

نصيحتان للمبتدئين:

  • ابدأ باستخدام الـ 1000 بيانة تاريخية التي قمت بمعالجتها سابقًا باستخدام النموذج القديم كاختبار. لا تقم بتغيير البيانات دفعة واحدة، بل راقب بسرعة ما إذا كانت زيادة دقة النموذج تغطي الزيادة في التكاليف. لقد قمنا بالاختبار لمدة يومين فقط وقررنا بعدها تغيير النموذج.
  • عند الاستخدام، يتم تفضيل النسخة الصغيرة o1-mini أولاً، وبالنسبة لـ 90% من فرق الشركات الصغيرة والمتوسطة، فإن قدرات o1-mini كافية تمامًا، بالإضافة إلى أن سعرها أقل بنسبة 60% من النسخة الكاملة o1.

وفي الختام، دعونا نتحدث عن السؤال الأكثر شيوعًا: هل سيتم استبدال o1 قريبًا بنماذج أخرى؟ على الأقل في سيناريو تحليل العناوين الذي نعمل عليه، لقد قمنا باختبار جميع النماذج الكبيرة للتنبؤ المتاحة في السوق، ولم يتمكن أي منها من تجاوز دقة o1. على الأقل في النصف الأول من العام القادم، سيظل هو الخيار الأول لدينا.

هل كان هذا مفيدًا؟

الدعم الفنيالدعم المباشر
侧栏
العودة إلى الأعلى
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR