เมนู

เราใช้ GPT-4o ในการเพิ่มอัตราความแม่นยำของบริการลูกค้าแบบหลายรูปแบบ (multimodal customer service) ให้ถึง 92% แต่ก็ต้องเจอปัญหา 3 อย่างที่ทำให้เราเจ็บปวดมาก

เมื่อเดือนที่แล้วทีมเทคโนโลยี 3 คนของเราในอีคอมเมิร์ซข้ามพรมแดนในเอเชียตะวันออกเฉียงใต้ใช้เวลา 3 วันและคืนเปลี่ยนระบบบริการลูกค้าอัจฉริยะจากรูปแบบข้อความขนาดใหญ่เก่าเป็น GPT-4o เดิมทีคิดว่ามันเป็นเพียงการเพิ่มฟังก์ชั่นการจดจําภาพ ผลลัพธ์ที่ได้คือการเปลี่ยนแปลงที่ใหญ่กว่าที่คาดไว้มากและเหยียบหลุมที่ไม่คาดคิดจํานวนมาก

สำหรับคนที่ยังไม่เคยได้ยินมาก่อน มาอธิบายให้เข้าใจกันชัดเจนก่อนนะ: GPT-4o คืออะไรกันแน่?

โดยพื้นฐานแล้วมันคือโมเดลการสร้างสรรค์แบบหลายรูปแบบ (multimodal generation model) ของ OpenAI และความแตกต่างที่สำคัญที่สุดเมื่อเทียบกับรุ่นก่อนๆ คือในรอบเดียวสามารถประมวลผลได้ทั้งข้อความ รูปภาพ และเสียง โดยไม่จำเป็นต้องแยกคำขอออกเพื่อเรียกใช้โมเดลที่แตกต่างกันไม่จำเป็นต้องทำการปรับแต่งรูปแบบข้อมูลเข้ามาเอง พารามิเตอร์ของอินเทอร์เฟซน้อยลงเกือบ 60% เมื่อเทียบกับการเรียกใช้งานแบบรวม

ทำไมเราต้องเปลี่ยนมันในปี 2026 นี้ล่ะ?

ก่อนหน้านี้ระบบบริการลูกค้าของเราสามารถจัดการกับการให้คําปรึกษาข้อความได้เท่านั้น ผู้ใช้ถ่ายภาพของสินค้าเสียหายและส่งสินค้าผิด ต้องแปลงเป็นคําอธิบายข้อความด้วยตนเองก่อนให้อาหารกับรูปแบบ ในช่วงโปรโมชั่นการเชื่อมโยงนี้เพียงอย่างเดียวปิดกั้นเกือบ 20% ของใบสั่งงานและอัตราการร้องเรียนของผู้ใช้เพิ่มขึ้นเป็นสองเท่าโดยตรงนอกจากนี้เรายังได้ลองใช้รูปแบบการจดจําภาพและรูปแบบข้อความประกอบด้วยความถูกต้องเพียง 76% การใช้งานหลังการขายที่ไม่ถูกต้องทําให้เกิดการสูญเสียค่าใช้จ่ายสูงกว่าค่าใช้จ่ายของรูปแบบ

ผลประโยชน์ที่เห็นได้ชัดเจนที่สุด 3 ประการหลังจากการเปลี่ยนแปลงนั้น ได้เกินความคาดหมายของเราอย่างมาก

Chart displaying global export goods data, highlighting key countries and trends.

  • อัตราการจัดการใบสั่งซ่อมหลังการขายเพิ่มขึ้นจาก 47% เป็น 92% โดยพนักงานบริการลูกค้าฝ่ายพาร์ทไทม์ที่เดิมทำหน้าที่แปลงรูปภาพถูกย้ายไปทำงานที่ซับซ้อนกว่า ทำให้ประหยัดค่าแรงได้เกือบ 1,800 ดอลลาร์ต่อเดือน
  • ผู้ใช้ที่ส่งคำถามด้วยภาษาท้องถิ่นไม่จำเป็นต้องผ่านอินเทอร์เฟซ ASR แยกต่างหากอีกต่อไป สามารถส่งข้อมูลไปยังโมเดลโดยตรงเพื่อให้โมเดลทำการระบุและให้คำตอบได้ คำขอส่วนใหญ่จะได้รับการประมวลผลภายในเวลา 15 มิลลิวินาที ทำให้ความเร็วในการตอบสนองโดยรวมเพิ่มขึ้นถึง 3 เท่า
  • การจัดการคำขอบริการหลังการขายที่มีทั้งรูปภาพและข้อความนั้น การใช้ทรัพยากร token น้อยลง 32% เมื่อเทียบกับการเรียกใช้แบบแยกกันระหว่างการรู้จำรูปภาพและแบบจำข้อความ ซึ่งหมายความว่าต้นทุนของแบบจำลองในช่วงที่มีการส่งเสริมการขายสูงสุดนั้นถูกกว่าก่อนหน้านี้

อย่ามองแต่ข้อดีเท่านั้น 3 ข้อเสียที่ซ่อนอยู่นี้เราเคยเจอมาจริงๆ และมันทำให้เราเสียหายจริงๆ

หลุมแรกคือเกณฑ์การ จํากัด ปัจจุบันที่เข้มงวดมากสําหรับการป้อนข้อมูลมัลติโหมดกว่าคําขอข้อความธรรมดาในวันแรกของการเปิดตัวออนไลน์ฉันเพิ่งพบกับกิจกรรมเฉลิมฉลองร้านค้าของเว็บไซต์เอเชียตะวันออกเฉียงใต้ 17% ของคําขอที่มีรูปภาพรายงาน 429 โดยตรงผู้ใช้ไม่สามารถมองเห็นการตอบสนองและคิดว่าการบริการลูกค้าวิ่งไปในวันนั้นมีความคิดเห็นเชิงลบมากกว่า 300ต่อมาเราสามารถเพิ่มคิวเดอเกรดแยกต่างหากให้กับคําขอที่มีรูปภาพและส่งกลับคําเตือน "ได้รับรูปภาพอยู่ระหว่างการประมวลผล" ในช่วงเวลาสูงสุดก่อนที่จะแก้ปัญหา

หลุมที่สองคือความถูกต้องในการจดจําภาพและข้อความในภาษาเล็ก ๆ ที่ไม่ใช่ภาษาอังกฤษนั้นต่ํากว่าที่ประชาสัมพันธ์ไว้เราพบกับใบส่งด่วนแบบลายมือภาษาอินโดนีเซียที่ส่งโดยผู้ใช้แบบจําลองรับรู้ตัวอักษรที่อยู่ผิด 3 ตัวและจัดที่อยู่คืนและแลกเปลี่ยนที่ผิดให้กับผู้ใช้โดยตรงและสูญเสียค่าขนส่งไปกลับเกือบ $ 200ตอนนี้เราเพิ่มชั้นของอินเทอร์เฟซ OCR ในท้องถิ่นในการจดจําภาพของภาษาเล็ก ๆ เพื่อตรวจสอบอัตราข้อผิดพลาดในช่วงที่ยอมรับได้

หลุมที่สามคือกฎการนับโทเค็นสําหรับเอาต์พุตมัลติโหมดลมีความแตกต่างอย่างสิ้นเชิงจากข้อความธรรมดาและคุณไม่สามารถใช้สูตรก่อนหน้านี้เพื่อคาดการณ์ค่าใช้จ่ายได้เราไม่ได้เปลี่ยนเกณฑ์การเตือนงบประมาณในสัปดาห์แรกที่เราเปิดตัวและค่าใช้จ่ายสําหรับวันหยุดสุดสัปดาห์เกิน 40% ของงบประมาณรายเดือนจนกว่าการเงินจะแจ้งเตือนเรา

ควรเปลี่ยนตอนนี้หรือเปล่านะ? เราได้จัดทำเกณฑ์การตัดสินใจที่ชัดเจนไว้แล้ว

สถานการณ์ที่คุณสามารถเข้าไปโจมตีได้โดยตรง:

Smartphone displaying AI app with book on AI technology in background.

  • ธุรกิจของคุณเองจำเป็นต้องประมวลผลข้อมูลทั้งข้อความ รูปภาพ และเสียง ซึ่งอาจมีสองประเภทหรือมากกว่านั้นพร้อมกัน
  • ก่อนหน้านี้เราได้ใช้โมเดลหลายตัวร่วมกันในการประมวลผลแบบมัลติมอดัลติ (multi-modal processing) แต่มีค่าใช้จ่ายในการผสานรวมที่สูงและอัตราความแม่นยำยังไม่เพียงพอ
  • ผู้ใช้ของคุณส่วนใหญ่ใช้ภาษาอังกฤษ หรือภาษาหลักอื่นๆ ที่ GPT-4o สามารถรองรับได้อย่างครบถ้วน

สถานการณ์ที่คุณไม่จำเป็นต้องเสียเงินเลย:

  • ธุรกิจของคุณมีเพียงความต้องการในการประมวลผลข้อความเท่านั้น และโมเดลรุ่นก่อนหน้านี้ก็สามารถตอบสนองความต้องการด้านความแม่นยำได้แล้ว
  • ธุรกิจของคุณมุ่งเน้นไปที่ตลาดภาษาย่อยเป็นหลัก โดยมีความต้องการในการระบุข้อความที่เขียนด้วยลายมือในท้องถิ่นและเสียงพูดที่ใช้ในภาษาท้องถิ่นในปริมาณมาก
  • ทีมของคุณไม่มีบุคลากรเพิ่มเติมสำหรับการพัฒนากลยุทธ์การลดระดับ (downgrade strategy) หรือการติดตามตรวจสอบต้นทุน (cost monitoring)

2 ข้อแนะนำเชิงปฏิบัติสำหรับทีมที่เพิ่งเริ่มต้น

ประการแรกก่อนที่จะออนไลน์ก่อนที่จะทํางาน 7 วันของการจราจรเงาอย่าตัดคําขอ 100% โดยตรงส่งคําขอของผู้ใช้จริงไปยังระบบเดิมของคุณและ GPT-4o ในเวลาเดียวกันเปรียบเทียบความถูกต้องและต้นทุนของทั้งสองฝ่ายตรวจสอบว่าตรงกับความคาดหวังแล้วค่อยๆตัดการจราจรเราไม่ได้ทําขั้นตอนนี้ก่อนที่จะสูญเสียอย่างมาก

ประการที่สอง ควรตั้งค่าการแจ้งเตือนเมื่องบประมาณสำหรับคำขอแบบมัลติมอดัลต์ (multi-modal requests) โดยตรง โดยสามารถตั้งค่าเกณฑ์การแจ้งเตือนไว้ที่ร้อยละ 120 ของค่าใช้จ่ายที่คุณคาดการณ์ไว้ เพื่อป้องกันไม่ให้เกิดสถานการณ์ที่ค่าใช้จ่ายเกินงบประมาณ

คำถามที่พบบ่อย

คำถาม: ควรรอจนกว่าจะมีโมเดลรุ่นต่อไปออกมาก่อนที่จะเปลี่ยนหรือไม่?

คำตอบ: อย่างน้อยในสถานการณ์ของการผสานรวมข้อมูลหลายรูปแบบ (multi-modal integration) ความเชี่ยวชาญของ GPT-4o ในปัจจุบันก็เพียงพอที่จะแก้ปัญหาจริงได้แล้ว ส่วนรุ่นถัดไปน่าจะต้องใช้เวลาอีกอย่างน้อยหนึ่งปีขึ้นไป ดังนั้นไม่จำเป็นต้องเสียค่าใช้จ่ายที่สามารถประหยัดได้ในตอนนี้ไปกับการอัปเกรดที่ยังไม่แน่นอน

คำถาม: มีความคุ้มค่าเมื่อเทียบกับโมเดลมัลติมอดัลต์แบบโอเพนซอร์สหรือไม่?

ถ้าทีมของคุณมีความสามารถในการปรับแต่งและนำโมเดลโอเพนซอร์สไปใช้งานเอง รวมทั้งมีความต้องการความเป็นส่วนตัวของข้อมูลสูง การใช้โมเดลโอเพนซอร์สก็จะคุ้มค่ากว่า แต่ถ้าไม่ใช่กรณีนั้น การใช้ GPT-4o โดยตรงจะมีต้นทุนที่ถูกกว่าการตั้งเซิร์ฟเวอร์และดูแลระบบเองมาก

มีประโยชน์หรือไม่?

ฝ่ายสนับสนุนด้านเทคนิคบริการลูกค้าออนไลน์
侧栏
กลับไปด้านบน
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR