การนำ LLM (Large Language Model) ไปใช้งานในระดับองค์กร: เราสามารถลดข้อผิดพลาดที่เกิดจากการใช้งาน LLM จาก 13% ลงเหลือ 0 และยังประหยัดต้นทุนได้ถึง 28% อีกด้วย
เมื่อเดือนที่แล้ว 3 ทีมเทคโนโลยีอีคอมเมิร์ซข้ามพรมแดนของเราในสิงคโปร์หมอบอยู่ในห้องตรวจสอบเป็นเวลา 36 ชั่วโมงในที่สุดก็จ้องมองเส้นโค้งของอัตราความสําเร็จของคําขอเกือบจะกระโดดขึ้นโหนดโปรโมชั่นใหญ่เดียวกันเมื่อปีที่แล้วเรา จํากัด ปัจจุบันเนื่องจากผู้ให้บริการ LLM เดียว13% ของคำขอสร้างคำอธิบายสินค้าได้รับข้อผิดพลาด “429” โดยตรงระบบหลังบ้านของร้านค้าล่มมาเกือบ 4 ชั่วโมงแล้ว และมีเพียงข้อร้องเรียนจากลูกค้ามากกว่า 2,000 ข้อเท่านั้น
ก่อนอื่นเราต้องเข้าใจกันว่า “ระบบประมวลผลการอนุมานสำหรับการใช้งานในระดับองค์กร” (Enterprise-level inference gateway) คืออะไรกันแน่
มันไม่ใช่เฟรมเวิร์กใหม่ที่ซับซ้อนอะไรมากนัก โดยพื้นฐานแล้วมันเป็นเพียงชั้นจัดสรรการรับส่งข้อมูล (traffic scheduling layer) ที่อยู่ระหว่างบริการธุรกิจของคุณกับอินเทอร์เฟซของ AI ต่างๆ (LLMs) โดยพารามิเตอร์หลักที่ใช้ในการควบคุมการทำงานนั้นค่อนข้างเรียบง่ายภายใต้ภาระการทำงานปกติ ความล่าช้าในการจัดสรรงาน (scheduling delay) ไม่ควรเกิน 10 มิลลิวินาทีหากเกินกว่านั้น ก็เท่ากับว่ากำลังทำให้ธุรกิจชะลอตัวลง
3 ข้อได้เปรียบที่แท้จริงที่เราได้รับหลังจากเผชิญกับปัญหาและสรุปออกมา

- ประการแรกคือการกําจัดความเสี่ยงของการ จํากัด ปัจจุบันโดยตรง: ตอนนี้เราได้รับผู้ให้บริการ LLM หลัก 3 รายในเวลาเดียวกันเกตเวย์จะจัดสรรคําขอให้กับโหนดที่มีโควต้าปัจจุบันเพียงพอและตอบสนองได้เร็วที่สุดโดยอัตโนมัติ ในปีนี้ QPS สูงกว่าปีที่แล้ว 2.3 เท่าและไม่มีชุด 429 ในกระบวนการทั้งหมด
- ประการที่สองคือการลดต้นทุนที่มองเห็นได้ด้วยตาเปล่า: เราสร้างคําขอป้ายสินค้าโภคภัณฑ์ลําดับความสําคัญต่ําโดยอัตโนมัติเส้นทางไปยังรูปแบบขนาดเล็กที่มีประสิทธิภาพค่าใช้จ่ายสูงขึ้นโดยไม่ต้องเปลี่ยนรหัสธุรกิจ 7 วันประหยัดค่าใช้จ่ายโทเค็นโดยตรง 28%
- ในที่สุดก็ประหยัดภาระงานซ้ํา ๆ ของ : ทุกครั้งที่เปลี่ยนรูปแบบหรือเพิ่มผู้ให้บริการใหม่ก่อนหน้านี้การปรับตัวอินเทอร์เฟซของโมดูลธุรกิจ 3 โมดูลจะต้องเปลี่ยนทีละโมดูล ตอนนี้มันเสร็จสมบูรณ์ในระดับเกตเวย์และสามารถทําได้ภายในครึ่งวัน
อย่ามองแต่ข้อดีเท่านั้น พวกเราเคยตกอยู่ใน “โพรงร้าย” เหล่านี้มาแล้วอย่างจริงจัง

ในสัปดาห์แรกของการเปิดตัวเรามีอุบัติเหตุ: หลังจากเปิดฟังก์ชั่นการถอยหลังอัตโนมัติเกตเวย์ตัดชุดของคําขอคัดลอกที่กําหนดเองลําดับความสําคัญสูงที่จะเรียก GPT-4 ไปยังแบบจําลองขนาดเล็กที่มีประสิทธิภาพไม่ดีมากส่งผลให้เนื้อหาคัดลอกโฆษณาของร้านค้ามากกว่า 200 รายการไม่มีคุณสมบัติเหมาะสมและในที่สุดก็เสียค่าใช้จ่ายคูปองส่งเสริมการขาย 10,000 หยวนต่อมาเรารู้ว่าไม่ใช่คําขอทั้งหมดที่เหมาะสมสําหรับการลดระดับอัตโนมัติและกรณีที่มีความละเอียดอ่อนสูงต้องมีการตรวจสอบด้านล่าง
ยังมีปัญหาเรื่องต้นทุนอีกมากมายที่หลายคนยังไม่ได้พูดถึง: หากค่า QPS ของคุณต่ำกว่า 10 ในระยะยาว ค่าใช้จ่ายในการเช่าเซิร์ฟเวอร์และการบำรุงรักษาของเว็บไกเกอร์เองจะสูงกว่าค่าบริการแพ็กเกจระดับสูงที่คุณซื้อจากผู้ให้บริการ LLM อย่างแน่นอน ดังนั้นจึงไม่มีความจำเป็นเลยที่จะต้องใช้มัน
นอกจากนี้อย่าเชื่อว่า "ฟังก์ชั่นเต็มรูปแบบพร้อมใช้งาน" เราลองเกตเวย์โอเพนซอร์ส 3 แบบ กฎการกระจายการจราจรเริ่มต้นไม่ตรงกับสถานการณ์อีคอมเมิร์ซเลย ใช้เวลา 2 วันเต็มในการปรับกฎการถ่วงน้ําหนัก
ใครควรจะได้รับโอกาสนี้? ใครบ้างที่ไม่ควรเสียเวลาไปเลย
ให้มาตรฐานการตัดสินใจมาเลย อย่าลังเล:
- หากเป็นไปตามเงื่อนไขใดเงื่อนไขหนึ่งต่อไปนี้ ก็สามารถพิจารณาได้: จำนวนคำขอจาก LLM มากกว่า 10,000 ครั้งต่อวัน, ใช้มากกว่า 2 แบบของโมเดลในเวลาเดียวกัน, หรือมีความต้องการความพร้อมใช้งานของบริการสูงกว่า 99.9%;
- หากทีมงานของคุณเป็นสตาร์ทอัพขนาดเล็กที่มีน้อยกว่า 5 คนไม่มีการผูกมัดที่แข็งแกร่งสําหรับธุรกิจหลักและการโทรแบบจําลองขนาดใหญ่และค่าใช้จ่ายของ LLM หนึ่งเดือนไม่สูงกว่าเงินเดือนรายเดือนของวิศวกรหลังเอ็นอย่าสัมผัสกับชุดการปรับใช้ระดับองค์กรนี้โดยตรงกับอินเทอร์เฟซพื้นเมืองของผู้ให้บริการที่ดีที่สุด
2 ข้อแนะนำเชิงปฏิบัติสำหรับผู้เริ่มต้นครั้งแรก
อย่ามาสลับเต็มรูปแบบครั้งแรกใช้ 10% ของการจราจรลําดับความสําคัญต่ําเพื่อวิ่งระดับสีเทาเป็นเวลาหนึ่งสัปดาห์โดยมุ่งเน้นไปที่ตัวชี้วัดสองประการ: มีการส่งคําขอซ้ําหรือไม่และความล่าช้าที่เกิดจากการจัดตารางเวลาอยู่ในช่วงที่ยอมรับได้หรือไม่ในเวลานั้นเราวัดปริมาณการจราจรของการตอบสนองอัตโนมัติหลังการขายเป็นเวลา 3 วันเพื่อกําหนดธุรกิจหลักที่ตัดโดยไม่มีหลุม
คำถาม: ควรสร้างเกตเวย์ขึ้นมาใหม่จากศูนย์เองไหม? คำตอบ: เว้นแต่ว่าทีมของคุณจะมีคนว่างมากจริงๆ การใช้เวอร์ชันโอเพนซอร์สที่พร้อมใช้งานแล้วและปรับแต่งมันจะช่วยประหยัดเวลาได้อย่างน้อย 2 เดือน และยังมีความเสถียรมากกว่าการเขียนขึ้นมาใหม่ด้วยตัวเองอีกด้วย
มีประโยชน์หรือไม่?