เมนู

เราได้ใช้ OpenAI o1 เพื่อเพิ่มอัตราการจับคู่ที่แม่นยำของที่อยู่ด้านลอจิสติกส์ให้สูงสุด แต่ก็พบกับปัญหาที่ไม่คาดคิด 3 ประการ

เมื่อสัปดาห์ที่แล้วทีมแบ็คเอ็นด์ 3 คนในยุโรปของเราในที่สุดก็โล่งใจ: เมื่อปีที่แล้วมีการส่งเสริม 13% ของคําขอการวิเคราะห์ที่อยู่เนื่องจากการ จํากัด กระแสแบบจําลองเดียวโดยตรงรายงาน 429 ในปีนี้ไม่เพียง แต่ไม่มีการ จํากัด กระแสเดียวเท่านั้นอัตราข้อผิดพลาดของการจับคู่ที่อยู่ยังลดลงโดยตรง 82%การเปลี่ยนแปลงหลักคือการเปลี่ยนแบบจําลองการให้เหตุผลหลักของเราเป็น o1

สำหรับคนที่ยังไม่เคยรู้จักมาก่อน ขออธิบายให้ชัดเจนนะครับ: o1 คืออะไรกันแน่?

OpenAI เปิดตัวแบบจําลองขนาดใหญ่ที่เพิ่มการให้เหตุผลซึ่งแตกต่างจาก GPT-4o ก่อนหน้านี้มันจะใช้เวลามากขึ้นในการ "คิด" เกี่ยวกับปัญหาตรรกะที่ซับซ้อนคะแนนการทดสอบความสามารถในการให้เหตุผลขั้นพื้นฐานอย่างเป็นทางการสูงกว่า GPT-4o ถึง 87% เราเลือกพารามิเตอร์นี้ตั้งแต่เริ่มต้น

สำหรับทีมขนาดเล็กและขนาดกลางอย่างเราแล้ว ข้อดีของ o1 นั้นเห็นได้ชัดเจนจริงๆ

ประโยชน์แรกจะแก้ไขปัญหาการจับคู่ที่อยู่ที่เจ็บหัวมากที่สุดของเราโดยตรงก่อนหน้านี้เมื่อใช้ GPT-4o เรามักจะสับสนถนนที่มีชื่อเดียวกันและรหัสไปรษณีย์ซ้ํากันในประเทศต่างๆ ในยุโรป โดยเฉพาะอย่างยิ่งผู้ใช้ที่ป้อนที่อยู่ที่มีการสะกดผิด เราต้องเพิ่มการตรวจสอบกฎ 3 ชั้นเพื่อให้ความถูกต้องแทบจะไม่ถึง 92% ตอนนี้ o1 ดึงความถูกต้องโดยตรงถึง 98.7% กองของรหัสกฎที่เราได้ลบทั้งหมดเมื่อสัปดาห์ที่แล้ว

ประการที่สองคือไม่ต้องทําวิศวกรรมพร้อมท์ที่ซับซ้อนอีกต่อไปก่อนหน้านี้เพื่อให้เอาต์พุตแบบจําลองสอดคล้องกับผลการวิเคราะห์ของรูปแบบพื้นหลังของเรา prompt เขียนคํา 2,000 อย่างรวดเร็วและรูปแบบเอาต์พุตก็เบี่ยงเบนอยู่บ่อยครั้ง ตอนนี้ตราบใดที่คําสั่งบรรทัดเดียวสามารถทําได้ค่าใช้จ่ายในการบํารุงรักษา prompt ลดลงโดยตรงเป็น 0

ประการที่สามคือความเสถียรของคําขอพร้อมกันดีกว่าที่คาดไว้นอกจากนี้เรายังกังวลว่าเวลาในการให้เหตุผลที่ยาวนานจะนําไปสู่คิวและการตรวจสอบแสดงให้เห็นว่าคําขอส่วนใหญ่เสร็จสมบูรณ์ภายใน 15 ms มีเพียงไม่กี่ข้อสอบที่อยู่ข้ามประเทศที่ซับซ้อนโดยเฉพาะอย่างยิ่งที่เพิ่มขึ้นมากกว่า 200 ms ซึ่งอยู่ในช่วงที่ยอมรับได้ของเรา

แต่ข้อเสียของมันก็สามารถทำให้คุณตกอยู่ในสถานการณ์ที่ไม่คาดคิดได้จริงๆ

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

หลุมแรกคือการบริโภคโทเค็นสูงกว่า GPT-4oใน 3 วันแรกที่เราเพิ่งตัดต้นทุนการให้เหตุผลเพิ่มขึ้นโดยตรง 2.3 เท่า ต่อมาพบว่า o1 จะนับกระบวนการคิดของตนเข้ากับการบริโภคโทเค็นโดยอัตโนมัติ หากคุณไม่จําเป็นต้องดูตรรกะการให้เหตุผลของมันให้แน่ใจว่าปิดการส่งออกของกระบวนการคิดในพารามิเตอร์การเรียก หลังจากที่เราปิดต้นทุนลดลงโดยตรง 1.2 เท่าของก่อนหน้านี้เป็นที่ยอมรับอย่างสมบูรณ์

หลุมที่สองไม่เหมาะสําหรับการร้องขอความถี่สูงที่เรียบง่ายเราเริ่มต้นด้วยความพยายามที่จะตัดคําขอสอบถามที่อยู่ทั้งหมดเป็น o1 จากนั้นพบว่าที่อยู่ที่ไม่มีการสะกดผิดพลาดและรูปแบบมาตรฐานไม่มีความแตกต่างระหว่างความถูกต้องของ o1 และ GPT-4o แต่มีค่าใช้จ่ายเพิ่มเติม ตอนนี้เราเพิ่มการตรวจสอบล่วงหน้าง่ายๆ เฉพาะคําขอที่ไม่เป็นไปตามรูปแบบมาตรฐานเท่านั้นที่จะไป o1 ค่าใช้จ่ายลดลง 30%

หลุมที่สามคือการสนับสนุนการป้อนข้อมูลไม่มั่นคงพอสําหรับภาษานอกภาษาละตินเช่นภาษาจีนและภาษาอาหรับเรามีผู้ใช้จํานวนเล็กน้อยในตะวันออกกลางและที่อยู่ที่ป้อนเป็นภาษาอาหรับบางครั้งก็มีข้อผิดพลาดในการวิเคราะห์ปัญหานี้หลังจากที่เราส่งข้อเสนอแนะไปยัง OpenAI เรายังคงรอการแก้ไข แต่ตอนนี้เรายังคงทําการตรวจสอบเพิ่มเติมด้วยกฎท้องถิ่น

ใครควรจะใช้ o1? ใครห้ามแตะมันตอนนี้?

หากคุณกำลังจัดการกับงานที่ต้องใช้การคิดเชิงตรรกะ เช่น การจับคู่กฎที่ซับซ้อน การตรวจสอบเงื่อนไขหลายข้อ หรือการสร้างโค้ดง่ายๆ และคุณพบว่า GPT-4o มีขีดจำกัดด้านความแม่นยำ การเปลี่ยนมาใช้ o1 จะให้ผลตอบแทนที่คุ้มค่ามาก

แต่ถ้าคุณทำเพียงแค่การจัดประเภทข้อความง่ายๆ การสร้างเนื้อหา หรือการส่งคำขอที่มีรูปแบบมาตรฐานบ่อยครั้ง ก็ไม่จำเป็นเลยที่จะใช้ o1 มันเป็นการเสียเงินโดยเปล่าประโยชน์ แค่ GPT-4o หรือแม้แต่ GPT-3.5 ก็สามารถทำได้เช่นกัน

2 ข้อแนะนำสำหรับผู้ใช้ครั้งแรก

  • เราจะเริ่มทดสอบด้วยข้อมูลประวัติ 1,000 รายการที่คุณเคยประมวลผลด้วยโมเดลเก่าก่อน อย่าเปลี่ยนข้อมูลทั้งหมดทีเดียว คุณจะสามารถเห็นได้อย่างรวดเร็วว่าการเพิ่มความแม่นยำนั้นสามารถชดเชยค่าใช้จ่ายที่เพิ่มขึ้นได้หรือไม่ เราทดสอบเพียง 2 วันก็ตัดสินใจว่าจะเปลี่ยนโมเดล
  • เมื่อมีการเรียกใช้งาน จะเลือกเวอร์ชัน o1-mini เป็นอันดับแรก สำหรับสถานการณ์ของทีมขนาดเล็กและขนาดกลางถึง 90% ความสามารถของ o1-mini นั้นเพียงพออย่างแน่นอน และราคายังถูกกว่าเวอร์ชันเต็มรูปแบบ o1 ถึง 60% อีกด้วย

ปิดท้ายด้วยคําถามที่ทุกคนถามมากที่สุด: o1 จะถูกแทนที่ด้วยรุ่นอื่น ๆ ในไม่ช้าหรือไม่?อย่างน้อยในสถานการณ์การวิเคราะห์ที่อยู่ที่เราทําเราทดสอบแบบจําลองการให้เหตุผลขนาดใหญ่ทั้งหมดในตลาดในขณะนี้และไม่มีใครสามารถเกินความถูกต้องของ o1 อย่างน้อยก็ยังคงเป็นตัวเลือกแรกของเราในอีกครึ่งปีข้างหน้า

มีประโยชน์หรือไม่?

ฝ่ายสนับสนุนด้านเทคนิคบริการลูกค้าออนไลน์
侧栏
กลับไปด้านบน
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR