เมนู

Claude Fable 5 ลิปรั่ว 6 ชั่วโมงทดสอบผลจริง ฆ่าบ้าจริง?

Fable 5 เพิ่งเปิดตัว และคำแนะนำจากระบบก็รั่วไหลออกมาแล้ว:



หลังจากดูคำแนะนำเหล่านี้แล้ว มีหลายประเด็นที่สำคัญ:


  • ประการแรก Fable ได้เพิ่ม API สำหรับการจัดเก็บข้อมูลแบบถาวร (window.storage) ให้กับ Artifact ซึ่งก็คือเนื้อหาที่ถูกสร้างขึ้นโดยโค้ดของ Claude เช่น หน้าเว็บ HTML, คอมโพเนนต์ React ฯลฯ ก่อนหน้านี้ข้อมูลของ Artifact ไม่สามารถถูกบันทึกไว้ได้ และมันเหมือนกับเพียงการแสดงผลแบบชั่วคราว (demo) เท่านั้น ตอนนี้ข้อมูลสามารถถูกเก็บไว้ระหว่างการเข้าสู่ระบบ (session) และสามารถรองรับเครื่องมือต่างๆ ที่มีความสามารถ “จดจำ” ได้ เช่น ตารางคะแนน, เครื่องติดตามเวลาการทำงาน, ไดอารี่ ฯลฯ


  • ประการที่สอง, Fable ได้ปรับปรุงตรรกะทั้งหมดของตัวเชื่อมต่อ MCP App ให้ดีขึ้น หากคุณต้องการเชื่อมต่อกับบริการภายนอก (เช่น การสั่งซื้อ, แท็กซี่, เพลง ฯลฯ) Fable จะตรวจสอบคัมภีร์บริการที่มีให้ก่อน จากนั้นจึงนำตัวเลือกเหล่านั้นมาให้คุณยืนยัน โดยเฉพาะสำหรับบริการที่ต้องเสียเงิน มันมีระบบการยินยอมใช้บริการ (opt-in) ที่ละเอียดถี่ถ้วน


รวมถึง:


  • ประการที่สาม เมื่อ Fable ตรวจจับได้ว่ามีความต้องการด้านความปลอดภัยทางเครือข่าย ชีวเคมี และการกลั่น มันจะโอนการตอบสนองไปยังโมเดลรองที่มีประสิทธิภาพรองลงอย่าง Opus 4.8 โดยอัตโนมัติ และแจ้งให้ผู้ใช้ทราบเกี่ยวกับการลดระดับการทำงาน


  • ข้อที่สี่, Fable มีฟีเจอร์ใหม่เพิ่มเข้ามาคือ long_conversation_reminder (การเตือนเกี่ยวกับบทสนทนาที่ยาวนาน) เมื่อบทสนทนามีความยาวเกินไป, Fable จะเพิ่มข้อความเตือนไว้ที่ท้ายข้อมูลของผู้ใช้ เพื่อบอกให้โมเดลไม่ลืมบทสนทนาเดิม เพราะมันดำเนินไปนานเกินไป


ลิงก์ไฟล์คลัง:


https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/CLAUDE-FABLE-5.md


แม้ว่าการลดระดับความปลอดภัยสำหรับการใช้งานทั่วไปของ Mythos จะเป็นสิ่งที่คาดไว้แล้ว แต่จากข้อความเตือนในระบบนี้ ก็ยังสามารถเห็นได้ว่า Anthropic ให้ความสำคัญกับความปลอดภัยอย่างมาก


สิ่งที่ควรกล่าวถึงคือ ในข้อกำหนดเกี่ยวกับพฤติกรรมของ Fable นั้น ส่วนที่เกี่ยวข้องกับสุขภาพจิตมีความสำคัญมาก หากพิจารณาจากคดีฟ้องร้องเกี่ยวกับโรบอตสนทนาที่ทำให้เกิดการฆ่าตัวตายในช่วงหนึ่งหรือสองปีที่ผ่านมา ก็ไม่ยากที่จะเข้าใจว่าทำไมส่วนนี้ถึงถูกเขียนไว้อย่างละเอียดถี่ถ้วน...


ต้นฉบับดังนี้:



แปลดังนี้:


Claude ใส่ใจสุขภาพทางร่างกายและจิตใจของผู้คน และพยายามหลีกเลี่ยงการสนับสนุนหรือกระตุ้นพฤติกรรมที่ทำลายตนเอง เช่น การติดยาเสพติด การทำร้ายตัวเอง ปัญหาด้านอาหารหรือการออกกำลังกายที่ไม่เหมาะสม รวมถึงการพูดคุยกับตัวเองในแง่ลบอย่างรุนแรงหรือการวิจารณ์ตัวเอง

แม้ว่าผู้ใช้จะร้องขอโดยตรง คลอด์กก็สามารถหลีกเลี่ยงการสร้างเนื้อหาที่อาจสนับสนุนหรือเสริมสร้างพฤติกรรมที่นำไปสู่การทำลายตนเองได้

เมื่อพูดคุยเกี่ยวกับ “วิธีการจำกัดอันตราย” หรือ “แผนความปลอดภัย” กับผู้ที่มีความคิดฆ่าตัวตายหรือแรงจูงใจที่จะทำร้ายตัวเอง คลอด์จะไม่เอ่ยชื่อ ระบุรายการ หรืออธิบายรายละเอียดเฉพาะเจาะจง แม้ว่าจะเป็นเพื่อบอกผู้ใช้ว่าควรหลีกเลี่ยงสิ่งใด คลอด์ก็จะไม่พูดออกมา เนื่องจากการกล่าวถึงสิ่งเหล่านั้นอาจกระตุ้นผู้ใช้โดยไม่ตั้งใจได้


งั้นมาดูผลการทดสอบจริงกันใน Fable 5 ดีกว่า


นี่คือตัวอย่างการทำงานของ Fable 5 ที่คัดลอกมาจากเกม The Elder Scrolls:



Fable ใช้ ThreeJ ในการสร้างฉากป่าสามมิติ:



ซึ่งมีการจำลองวัตถุมากกว่า 5000 ชิ้น:



การสาธิตทิวทัศน์เมืองนิวยอร์ก:


เมืองสไตล์กอธิกถูกคลื่นทะเลกลืนหายไป:



x ผู้ใช้งานอินเทอร์เน็ต Victor Taelin ใช้โปรเจ็กต์จริงในการทดสอบ



HVM5มันเป็นระบบพื้นฐานที่เกี่ยวข้องกับการคำนวณความเร็วสูง มันเคยถูกใช้โดยเขามาก่อน มี 32 ตัวGPT-5Agent ทำงานไปประมาณ 20 ชั่วโมง แม้ว่าจะมีการเร่งความเร็วสูงสุดถึง 2 เท่า แต่คุณภาพของโค้ดกลับลดลงหลังจากที่มีการขยายโค้ด (code expansion) เมื่อต่อมา มันก็ได้รับการอนุญาตให้ใช้ Opus 4.8GPT-5.5การปรับปรุงใช้เวลา 8 ชั่วโมง โปรแกรม Opus มีการเร่งความเร็วที่มีประสิทธิภาพระหว่าง 6% ถึง 34% ส่วนผลลัพธ์จาก GPT นั้นดีกว่า แต่ไฟล์ไม่สามารถใช้งานได้



ผลลัพธ์คือ Fable 5 ใช้เวลาเพียง 2 ชั่วโมงเท่านั้น โดยมีเพียงหนึ่งเบนช์มาร์กที่มีการปรับปรุงเพิ่มขึ้นถึง 1770% ส่วนอีก 4 เบนช์มาร์กมีการเพิ่มขึ้นเกินกว่าค่าเฉลี่ยถึง 100% อีก 22%


ปฏิกิริยาแรกของผู้ใช้งานคือไม่เชื่อ สงสัยว่าเบนช์มาร์กเหล่านั้นอาจถูก “เขียนโค้ดไว้ล่วงหน้า” (hardcoded) เนื่องจากก่อนหน้านี้พวกเขาเคยประสบปัญหาในลักษณะเดียวกันกับ GPT



หลังจากอ่านคำอธิบายแล้ว เขาก็พบว่าทิศทางการปรับปรุงของ Fable นั้นมีเหตุผลจริงๆ


เนื่องจาก HVM5 ในการจัดการโหนดการจับคู่รูปแบบแบบไดนามิก (dynamic pattern-match) ส่วนใหญ่ของการแบ่งเส้นทางที่ไม่จำเป็นก็ถูกนำไปยังกระบวนการทิ้งขยะ (garbage collection) ซึ่งทำให้เสียเวลามาก ก่อนหน้านี้ผู้ใช้งานได้ปรับปรุงเฉพาะการจับคู่แบบสถิติ (static match) เท่านั้น ส่วนการจับคู่แบบไดนามิกไม่ได้รับการปรับปรุง Fable พบปัญหานี้ ดังนั้นผลลัพธ์จากการทดสอบจึงเกินจริงมาก


นี่คือการวิเคราะห์สาเหตุของบั๊ก HVM5 ที่ Fable 5 ให้มา:



Alican Kiraz ผู้ใช้งานจากตุรกี ได้ทำการทดสอบเปรียบเทียบระหว่าง Fable 5 กับ GPT 5.5 หลายครั้ง


ข้อสรุปของเขาคือ Fable 5 ใช้เงินมากถึง 360.55 ดอลลาร์ในการเล่น ในขณะที่ GPT-5.5 ใช้เงินเพียง 6 ดอลลาร์เท่านั้น แต่ถ้าดูจากการปรับแต่งรายละเอียดแล้ว Fable 5 ได้ทำการปรับแต่งในระดับที่ลึกซึ้งกว่า มีความเป็นมืออาชีพมากกว่า และใกล้เคียงกับวิธีคิดของวิศวกรด้านประสิทธิภาพมากขึ้น



นี่คือข้อสรุปจากการทดสอบของเขา:



ตามการทดสอบด้วยเครื่องมือการเขียนโปรแกรมจากบุคคลที่สามชื่อ Augment Code ในสถานการณ์จริง Fable 5 มีความสามารถในการเขียนโปรแกรมที่แข็งแกร่งมากจริงๆ


ในการทดสอบนี้ มีการดำเนินการโปรแกรมทั้งหมด 489 งาน และ Fable 5 มีผลการทำงานโดยรวมที่ดีกว่าอย่างเห็นได้ชัด ทั้งในด้านคะแนนรวม (+0.224) และความถูกต้อง (+0.191)



อย่างไรก็มีตัวอย่างที่น่าผิดหวังจากการทดสอบจริง เช่น ผู้ใช้งาน Ryan R. Hughes ได้ส่ง PR ขนาดใหญ่ที่มีไฟล์จำนวน 74 ไฟล์ให้ Fable 5 พิจารณา ผลคือ Fable 5 ใช้เวลาประมาณ 34 นาทีในการประมวลผล และใช้ทรัพยากรจากการสนทนา Claude Code ถึง 42% ในระหว่างนั้น ก่อนที่จะให้ข้อค้นพบเพียง 16 ข้อเท่านั้น



ตัวอย่างแบบนี้ไม่ใช่เรื่องแปลกเลย Fable 5 นั้นราคาค่อนข้างแพงไปหน่อย



บางคนคิดว่า หลังจากทดสอบจริงแล้ว Fable 5 มีความสามารถในการประมวลผลข้อความยาวได้ไม่ดีนัก



คำวิจารณ์ส่วนใหญ่มุ่งเน้นไปที่การลดคุณภาพของโมเดล (model degradation)



ปัจจุบัน Fable 5 มีราคา API อยู่ที่ 10 ดอลลาร์สหรัฐต่อล้านโทเค็นอินพุต และ 50 ดอลลาร์สหรัฐต่อล้านโทเค็นเอาต์พุต



เมื่อเปรียบเทียบแบบแนวนอน ราคานี้ประมาณสองเท่าของ Opus 4.8 และมากกว่าสามเท่าของ Sonnet 4.6 ต้นทุนจริงของกระบวนการทำงานที่ซับซ้อนเพียงกระบวนการเดียวสูงกว่าโมเดล Claude รุ่นก่อนหน้านี้อย่างเห็นได้ชัด


นอกจากนี้ ความไวของโมเดลก็ถูกปรับเพิ่มขึ้นด้วย: ระบบมีแนวโน้มที่จะระมัดระวังมากขึ้น โดยเลือกที่จะทำให้เกิดข้อผิดพลาดมากกว่าที่จะเสี่ยงและหาความมั่นคงก่อน


เพื่อแก้ไขปัญหาเรื่องต้นทุนที่สูงเกินไป ฉันได้รวบรวมข้อมูลการทดสอบจากผู้ใช้งานมาให้ ซึ่งไม่เพียงแต่จะช่วยประหยัดเงินของทุกคน แต่ยังให้ผลลัพธ์ที่ดีอีกด้วย นี่คือวิธีการใช้โมเดลร่วมกัน:


ใน IDE ที่รองรับโมเดลผสมผสานอย่าง Cursor คุณสามารถใช้โมเดลต่างๆ บนแพลตฟอร์มได้ในขั้นตอนต่างๆ:

ขั้นตอนที่ 1: การตรวจสอบโค้ดและการวิเคราะห์โครงการเบื้องต้น เพื่อเตรียมความพร้อมในการทำความเข้าใจโครงสร้างของโปรเจกต์ ใช้ GPT-5.5, High, MiniMax, M3, Kimi, K2.6 หรือ Composer 2.5 อย่างใดอย่างหนึ่ง

ขั้นตอนที่ 2: การจัดทำแผนโครงการ โดยใช้ GPT-5.5 (Very High) หรือ Opus 4.8 เพื่อเตรียมแผนการดำเนินงานของโปรเจกต์

ขั้นตอนที่สาม: การวิเคราะห์แผนโครงการ ใช้ Fable 5 เพื่อตรวจสอบแผนโครงการและหาส่วนที่อาจมีข้อผิดพลาด หากจำเป็นต้องแก้ไขแผน ให้ใช้ GPT-5.5 (ระดับ Very High)

ขั้นตอนที่สี่: การดำเนินการและการใช้แผนโครงการ ใช้ MiniMax, M3, DeepSeek, V4, Max, Composer 2.5 หรือ Sonnet 4.6 เพื่อทำตามแผนที่วางไว้

ขั้นตอนที่ห้า: การตรวจสอบครั้งสุดท้าย ใช้ GPT-5.5 (ระดับ High) เพื่อตรวจสอบผลลัพธ์สุดท้ายของการเขียนโค้ดและดูว่าการดำเนินการนั้นสอดคล้องกับแผนเดิมหรือไม่


การใช้พลังที่มีราคาแพงในที่ที่เหมาะสมที่สุดคือวิธีที่ถูกต้องในการเล่น Fable 5


Claude Fable 5 ว่ามันทำให้คุณ “บ้า” หรือไม่นั้น แต่ละคนมีความคิดเห็นต่างกันไป


แต่เมื่อคุณมีมันแล้ว อัตราการใช้ Token นั้นชัดเจนมาก มันจริงๆ แล้วทำให้คุณ “บ้า”



บทความนี้มาจาก WeChat Official Account “JackCui” โดยผู้เขียน “JackCui”

มีประโยชน์หรือไม่?

ฝ่ายสนับสนุนด้านเทคนิคบริการลูกค้าออนไลน์
กลับไปด้านบน
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR