เราสามารถลดอัตราความผิดพลาดในการร้องขอช่วงโปรโมชั่นให้เหลือ 0.2% ได้ด้วย GPT-4 Turbo อย่าทำผิดพลาดเหล่านี้อีกเลย
เมื่อเดือนที่แล้วในช่วงการลดราคา Black Friday เราทีมงานด้านการขนส่งข้ามพรมแดนในยุโรปที่มีสมาชิก 3 คน ไม่เคยเจอปัญหาที่ทำให้ทุกคนต้องทำงานตลอดทั้งคืนเพราะการตรวจสอบที่อยู่ของลูกค้าเหมือนครั้งก่อนๆ
ในช่วงเวลาเดียวกันของปีที่แล้วเรายังคงใช้ GPT-4 ทั่วไปเพื่อทํามาตรฐานที่อยู่ 13% ของคําขอในช่วงเวลาเร่งด่วนส่งกลับข้อผิดพลาด 429 โดยตรงและใช้เวลา 36 ชั่วโมงในการประมวลผลข้อร้องเรียนของลูกค้าเพียงอย่างเดียวปีนี้เปลี่ยนเป็น GPT-4 เทอร์โบไม่มีการเรียกใช้การ จํากัด ปัจจุบันในกระบวนการทั้งหมดอัตราข้อผิดพลาดถูกกดโดยตรงถึง0.2%。
ก่อนอื่นเรามาทำความเข้าใจกันว่า GPT-4 Turbo คืออะไรกันแน่?
พูดง่ายๆ ก็คือ OpenAI ได้พัฒนา GPT-4 ให้มีประสิทธิภาพการประมวลผลที่ดีขึ้น โดยเน้นการเพิ่มความเร็วในการทำงาน และพารามิเตอร์หลักที่ใช้ในการปรับแต่งระบบก็คือจำนวนคำขอที่บัญชีเดียวสามารถรองรับได้ต่อนาทีนั้นสูงกว่า GPT-4 แบบปกติถึง 6 เท่าต้นทุนของแต่ละโทเคนยังลดลงครึ่งหนึ่งอีกด้วย ซึ่งเป็นการปรับแต่งที่ทำมาเฉพาะสำหรับสถานการณ์ที่มีการใช้งานพร้อมกันสูง (high-concurrency scenarios)
3 ข้อดีที่แท้จริงสำหรับทีมเทคนิคขนาดเล็กและขนาดกลาง
สิ่งแรกที่ตรงไปตรงมาคือไม่จําเป็นต้องมีอาการปวดหัวสําหรับการ จํากัด กระแสอีกต่อไปเรามีคําขอการวิเคราะห์ที่อยู่เฉลี่ย 500,000 ครั้งต่อวัน ก่อนหน้านี้เราต้องซ้อนโมเดลขนาดใหญ่ของแพลตฟอร์มที่แตกต่างกัน 3 แพลตฟอร์มเพื่อสร้างความสมดุลโหลด เพียงแค่เกตเวย์ปรับตัวเราเขียนโค้ดมากกว่า 1000 บรรทัด ตอนนี้ GPT-4 Turbo เพียงอย่างเดียวสามารถรับการเข้าชมสูงสุดได้ 3 เท่าของฤดูกาลโปรโมชั่น
ประการที่สองคือการประมวลผลข้อความยาวที่มีประสิทธิภาพสูงเรามักจะต้องป้อนใบประกาศศุลกากรข้ามพรมแดนทั้งหน้าเพื่อทําการสกัดข้อมูล ก่อนหน้านี้ GPT-4 ทั่วไปมักจะแบ่งออกเป็น 3 คําขอเนื่องจากความยาวบริบทไม่เพียงพอ ตอนนี้เราสามารถประมวลผลได้ในครั้งเดียวใช้เวลาในการทํางานเดียวโดยตรงตัดสองในสาม
ข้อที่สามคือการประหยัดค่าใช้จ่ายจริงๆ พวกเราคำนวณค่าใช้จ่ายของเดือนที่แล้วแล้วพบว่า สำหรับปริมาณการร้องขอที่เท่ากัน ค่าใช้จ่ายของ GPT-4 Turbo นั้นเพียง 28% ของแผนการผสมผสานโมเดลหลายตัวก่อนหน้านี้เท่านั้น และเงินที่ประหยัดได้นั้นถูกนำไปเพิ่มเป็นเงินโบนัสให้กับทีมเป็นเวลาสองเดือน
อย่ามองแต่ข้อดีนะ พวกเราเคยเจอปัญหาเหล่านี้มาแล้ว 3 ข้อ

หลุมแรกเป็นภารกิจที่มีความซับซ้อนต่ํา แต่ไม่คุ้มค่าเราเริ่มต้นด้วยการตัดคําขอตรวจสอบที่อยู่ทั้งหมดและค้นพบว่างานง่ายๆของ "การตัดสินว่าที่อยู่เป็นของสหภาพยุโรป" มีค่าใช้จ่ายสูงกว่าสามเท่าของ GPT-4 Turbo เมื่อเทียบกับรุ่นน้ําหนักเบาและตอนนี้เราได้เบี่ยงเบนคําของ่ายๆ เหล่านี้ไปยังรุ่นที่มีขนาดเล็ก
หลุมที่สองเป็นเวลาตอบสนองเริ่มต้น แต่นานกว่า GPT-4 ทั่วไปเล็กน้อยเมื่อเราสลับครั้งแรกเราพบว่ามีคําขอเล็ก ๆ น้อย ๆ ที่ต้องรอมากกว่า 200 ms ต่อมาเรารู้ว่าโหมดอัตราการผลิตสูงจะให้ความสําคัญกับการรับประกันว่าคําขอจะไม่ถูกปฏิเสธมากกว่าความล่าช้าต่ํามาก เราเปิดพารามิเตอร์ความล่าช้าต่ําแยกต่างหากสําหรับคําขอสอบถามด้านหน้าที่ต้องการการตอบสนองอย่างรวดเร็วเพื่อแก้ปัญหา
หลุมที่สามคือการควบคุมอนุภาคละเอียดน้อยลงGPT-4 ทั่วไปสามารถปรับแต่งอุณหภูมิของโมเดล, top p และพารามิเตอร์อื่น ๆ ในช่วงที่แม่นยํามาก ช่วงที่สามารถปรับได้ของ GPT-4 Turbo จํากัด มาก สําหรับสถานการณ์ที่จําเป็นต้องควบคุมรูปแบบเอาต์พุตได้อย่างแม่นยํา (เช่นสําเนาประกาศศุลกากรที่เราสร้างให้กับลูกค้า) เรายังคงต้องตัดกลับไปที่รุ่นปกติ
ใครควรจะใช้มัน? แล้วใครกันแน่ที่ไม่จำเป็นต้องมาร่วมความวุ่นวายนี้?
หากคุณเป็นทีมขนาดเล็กหรือขนาดกลาง และตรงตามสามเงื่อนไขนี้ ให้ดำเนินการทันที:
- มีการร้องขอจากโมเดลขนาดใหญ่มากกว่า 100,000 ครั้งต่อวันในช่วงเวลาปกติ
- มักจะต้องทำงานกับข้อความยาวที่มีความยาวมากกว่า 8,000 คำ
- ก่อนหน้านี้มักจะต้องทำการกระจายภาระการทำงานระหว่างโมเดลต่างๆ เพื่อรองรับข้อจำกัดด้านการรับส่งข้อมูล (ลิมิตเทิด)
ถ้าทีมของคุณมีปริมาณการร้องขอต่อวันน้อยกว่า 10,000 ครั้ง หรืองานที่ทำเป็นเพียงการจัดหมวดหมู่และการดึงข้อมูลที่เรียบง่าย ก็ไม่จำเป็นต้องเปลี่ยนเลย โมเดลขนาดเบาก็เพียงพอสำหรับการใช้งาน และยังมีต้นทุนที่ถูกกว่าอีกด้วย
2 ข้อแนะนำเฉพาะสำหรับผู้เริ่มต้น
อย่าตัดเต็มรูปแบบในสัปดาห์แรกก่อนนํา 10% ของคําขอข้อความยาวพร้อมกันสูงไปยังระดับสีเทาดูข้อมูลการตรวจสอบของสัปดาห์แล้วค่อยๆเพิ่มปริมาณเราตัด 30% ในวันแรกเกือบจะเกิดข้อผิดพลาดในการสกัดใบแจ้งศุลกากรบางส่วนเนื่องจากไม่มีพารามิเตอร์การปรับตัว
โดยไม่ต้องสํารองบริบทที่ยาวเกินไปล่วงหน้า บริบท 128k ของ GPT-4 Turbo เพียงพอสําหรับสถานการณ์ระดับองค์กรส่วนใหญ่ เราได้ลองป้อนสัญญาโลจิสติกส์ 30 หน้าทั้งหมดเพื่อทําการตรวจสอบเงื่อนไข ไม่มีความแตกต่างระหว่างความถูกต้องของการส่งออกและการประมวลผลแบบบล็อก
2 คำถามที่ทุกคนมักจะถามบ่อย ๆ
Q: จะมีคุณภาพการผลิตผลที่แย่กว่า GPT-4 แบบปกติหรือไม่?
A: เราได้ทำการทดสอบกับชุดข้อมูลที่มีการตรวจสอบที่อยู่จำนวน 1000 ชุด และพบว่าอัตราความแม่นยำอยู่ที่ 98.7% ซึ่งแทบไม่ต่างจาก GPT-4 แบบปกติที่มีอัตราความแม่นยำ 98.9% เลย ซึ่งเพียงพอสำหรับการใช้งานในสภาพแวดล้อมระดับองค์กรอย่างแน่นอน
Q: จำเป็นต้องทำโปรเจ็กต์ Prompt ใหม่หรือไม่?
A: เราได้นำ Prompt ทั้งหมดที่เคยเขียนไว้สำหรับ GPT-4 มาใช้โดยตรง โดยไม่มีการปรับเปลี่ยนแต่อย่างใด และผลลัพธ์ที่ได้ก็ตรงตามที่คาดไว้ทุกประการ
มีประโยชน์หรือไม่?