Claude Fable 5 ลิปรั่ว 6 ชั่วโมงทดสอบผลจริง ฆ่าบ้าจริง?
Fable 5 เพิ่งเปิดตัว และคำแนะนำจากระบบก็รั่วไหลออกมาแล้ว:

หลังจากดูคำแนะนำเหล่านี้แล้ว มีหลายประเด็นที่สำคัญ:
- ประการแรก Fable ได้เพิ่ม API สำหรับการจัดเก็บข้อมูลแบบถาวร (
window.storage) ให้กับ Artifact ซึ่งก็คือเนื้อหาที่ถูกสร้างขึ้นโดยโค้ดของ Claude เช่น หน้าเว็บ HTML, คอมโพเนนต์ React ฯลฯ ก่อนหน้านี้ข้อมูลของ Artifact ไม่สามารถถูกบันทึกไว้ได้ และมันเหมือนกับเพียงการแสดงผลแบบชั่วคราว (demo) เท่านั้น ตอนนี้ข้อมูลสามารถถูกเก็บไว้ระหว่างการเข้าสู่ระบบ (session) และสามารถรองรับเครื่องมือต่างๆ ที่มีความสามารถ “จดจำ” ได้ เช่น ตารางคะแนน, เครื่องติดตามเวลาการทำงาน, ไดอารี่ ฯลฯ
- ประการที่สอง, Fable ได้ปรับปรุงตรรกะทั้งหมดของตัวเชื่อมต่อ MCP App ให้ดีขึ้น หากคุณต้องการเชื่อมต่อกับบริการภายนอก (เช่น การสั่งซื้อ, แท็กซี่, เพลง ฯลฯ) Fable จะตรวจสอบคัมภีร์บริการที่มีให้ก่อน จากนั้นจึงนำตัวเลือกเหล่านั้นมาให้คุณยืนยัน โดยเฉพาะสำหรับบริการที่ต้องเสียเงิน มันมีระบบการยินยอมใช้บริการ (opt-in) ที่ละเอียดถี่ถ้วน
รวมถึง:
- ประการที่สาม เมื่อ Fable ตรวจจับได้ว่ามีความต้องการด้านความปลอดภัยทางเครือข่าย ชีวเคมี และการกลั่น มันจะโอนการตอบสนองไปยังโมเดลรองที่มีประสิทธิภาพรองลงอย่าง Opus 4.8 โดยอัตโนมัติ และแจ้งให้ผู้ใช้ทราบเกี่ยวกับการลดระดับการทำงาน
- ข้อที่สี่, Fable มีฟีเจอร์ใหม่เพิ่มเข้ามาคือ long_conversation_reminder (การเตือนเกี่ยวกับบทสนทนาที่ยาวนาน) เมื่อบทสนทนามีความยาวเกินไป, Fable จะเพิ่มข้อความเตือนไว้ที่ท้ายข้อมูลของผู้ใช้ เพื่อบอกให้โมเดลไม่ลืมบทสนทนาเดิม เพราะมันดำเนินไปนานเกินไป
ลิงก์ไฟล์คลัง:
https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/CLAUDE-FABLE-5.md
แม้ว่าการลดระดับความปลอดภัยสำหรับการใช้งานทั่วไปของ Mythos จะเป็นสิ่งที่คาดไว้แล้ว แต่จากข้อความเตือนในระบบนี้ ก็ยังสามารถเห็นได้ว่า Anthropic ให้ความสำคัญกับความปลอดภัยอย่างมาก
สิ่งที่ควรกล่าวถึงคือ ในข้อกำหนดเกี่ยวกับพฤติกรรมของ Fable นั้น ส่วนที่เกี่ยวข้องกับสุขภาพจิตมีความสำคัญมาก หากพิจารณาจากคดีฟ้องร้องเกี่ยวกับโรบอตสนทนาที่ทำให้เกิดการฆ่าตัวตายในช่วงหนึ่งหรือสองปีที่ผ่านมา ก็ไม่ยากที่จะเข้าใจว่าทำไมส่วนนี้ถึงถูกเขียนไว้อย่างละเอียดถี่ถ้วน...
ต้นฉบับดังนี้:

แปลดังนี้:
Claude ใส่ใจสุขภาพทางร่างกายและจิตใจของผู้คน และพยายามหลีกเลี่ยงการสนับสนุนหรือกระตุ้นพฤติกรรมที่ทำลายตนเอง เช่น การติดยาเสพติด การทำร้ายตัวเอง ปัญหาด้านอาหารหรือการออกกำลังกายที่ไม่เหมาะสม รวมถึงการพูดคุยกับตัวเองในแง่ลบอย่างรุนแรงหรือการวิจารณ์ตัวเอง
แม้ว่าผู้ใช้จะร้องขอโดยตรง คลอด์กก็สามารถหลีกเลี่ยงการสร้างเนื้อหาที่อาจสนับสนุนหรือเสริมสร้างพฤติกรรมที่นำไปสู่การทำลายตนเองได้
เมื่อพูดคุยเกี่ยวกับ “วิธีการจำกัดอันตราย” หรือ “แผนความปลอดภัย” กับผู้ที่มีความคิดฆ่าตัวตายหรือแรงจูงใจที่จะทำร้ายตัวเอง คลอด์จะไม่เอ่ยชื่อ ระบุรายการ หรืออธิบายรายละเอียดเฉพาะเจาะจง แม้ว่าจะเป็นเพื่อบอกผู้ใช้ว่าควรหลีกเลี่ยงสิ่งใด คลอด์ก็จะไม่พูดออกมา เนื่องจากการกล่าวถึงสิ่งเหล่านั้นอาจกระตุ้นผู้ใช้โดยไม่ตั้งใจได้
งั้นมาดูผลการทดสอบจริงกันใน Fable 5 ดีกว่า
นี่คือตัวอย่างการทำงานของ Fable 5 ที่คัดลอกมาจากเกม The Elder Scrolls:

Fable ใช้ ThreeJ ในการสร้างฉากป่าสามมิติ:

ซึ่งมีการจำลองวัตถุมากกว่า 5000 ชิ้น:

การสาธิตทิวทัศน์เมืองนิวยอร์ก:

เมืองสไตล์กอธิกถูกคลื่นทะเลกลืนหายไป:

x ผู้ใช้งานอินเทอร์เน็ต Victor Taelin ใช้โปรเจ็กต์จริงในการทดสอบ

HVM5มันเป็นระบบพื้นฐานที่เกี่ยวข้องกับการคำนวณความเร็วสูง มันเคยถูกใช้โดยเขามาก่อน มี 32 ตัวGPT-5Agent ทำงานไปประมาณ 20 ชั่วโมง แม้ว่าจะมีการเร่งความเร็วสูงสุดถึง 2 เท่า แต่คุณภาพของโค้ดกลับลดลงหลังจากที่มีการขยายโค้ด (code expansion) เมื่อต่อมา มันก็ได้รับการอนุญาตให้ใช้ Opus 4.8GPT-5.5การปรับปรุงใช้เวลา 8 ชั่วโมง โปรแกรม Opus มีการเร่งความเร็วที่มีประสิทธิภาพระหว่าง 6% ถึง 34% ส่วนผลลัพธ์จาก GPT นั้นดีกว่า แต่ไฟล์ไม่สามารถใช้งานได้

ผลลัพธ์คือ Fable 5 ใช้เวลาเพียง 2 ชั่วโมงเท่านั้น โดยมีเพียงหนึ่งเบนช์มาร์กที่มีการปรับปรุงเพิ่มขึ้นถึง 1770% ส่วนอีก 4 เบนช์มาร์กมีการเพิ่มขึ้นเกินกว่าค่าเฉลี่ยถึง 100% อีก 22%
ปฏิกิริยาแรกของผู้ใช้งานคือไม่เชื่อ สงสัยว่าเบนช์มาร์กเหล่านั้นอาจถูก “เขียนโค้ดไว้ล่วงหน้า” (hardcoded) เนื่องจากก่อนหน้านี้พวกเขาเคยประสบปัญหาในลักษณะเดียวกันกับ GPT

หลังจากอ่านคำอธิบายแล้ว เขาก็พบว่าทิศทางการปรับปรุงของ Fable นั้นมีเหตุผลจริงๆ
เนื่องจาก HVM5 ในการจัดการโหนดการจับคู่รูปแบบแบบไดนามิก (dynamic pattern-match) ส่วนใหญ่ของการแบ่งเส้นทางที่ไม่จำเป็นก็ถูกนำไปยังกระบวนการทิ้งขยะ (garbage collection) ซึ่งทำให้เสียเวลามาก ก่อนหน้านี้ผู้ใช้งานได้ปรับปรุงเฉพาะการจับคู่แบบสถิติ (static match) เท่านั้น ส่วนการจับคู่แบบไดนามิกไม่ได้รับการปรับปรุง Fable พบปัญหานี้ ดังนั้นผลลัพธ์จากการทดสอบจึงเกินจริงมาก
นี่คือการวิเคราะห์สาเหตุของบั๊ก HVM5 ที่ Fable 5 ให้มา:

Alican Kiraz ผู้ใช้งานจากตุรกี ได้ทำการทดสอบเปรียบเทียบระหว่าง Fable 5 กับ GPT 5.5 หลายครั้ง
ข้อสรุปของเขาคือ Fable 5 ใช้เงินมากถึง 360.55 ดอลลาร์ในการเล่น ในขณะที่ GPT-5.5 ใช้เงินเพียง 6 ดอลลาร์เท่านั้น แต่ถ้าดูจากการปรับแต่งรายละเอียดแล้ว Fable 5 ได้ทำการปรับแต่งในระดับที่ลึกซึ้งกว่า มีความเป็นมืออาชีพมากกว่า และใกล้เคียงกับวิธีคิดของวิศวกรด้านประสิทธิภาพมากขึ้น

นี่คือข้อสรุปจากการทดสอบของเขา:

ตามการทดสอบด้วยเครื่องมือการเขียนโปรแกรมจากบุคคลที่สามชื่อ Augment Code ในสถานการณ์จริง Fable 5 มีความสามารถในการเขียนโปรแกรมที่แข็งแกร่งมากจริงๆ
ในการทดสอบนี้ มีการดำเนินการโปรแกรมทั้งหมด 489 งาน และ Fable 5 มีผลการทำงานโดยรวมที่ดีกว่าอย่างเห็นได้ชัด ทั้งในด้านคะแนนรวม (+0.224) และความถูกต้อง (+0.191)

อย่างไรก็มีตัวอย่างที่น่าผิดหวังจากการทดสอบจริง เช่น ผู้ใช้งาน Ryan R. Hughes ได้ส่ง PR ขนาดใหญ่ที่มีไฟล์จำนวน 74 ไฟล์ให้ Fable 5 พิจารณา ผลคือ Fable 5 ใช้เวลาประมาณ 34 นาทีในการประมวลผล และใช้ทรัพยากรจากการสนทนา Claude Code ถึง 42% ในระหว่างนั้น ก่อนที่จะให้ข้อค้นพบเพียง 16 ข้อเท่านั้น

ตัวอย่างแบบนี้ไม่ใช่เรื่องแปลกเลย Fable 5 นั้นราคาค่อนข้างแพงไปหน่อย

บางคนคิดว่า หลังจากทดสอบจริงแล้ว Fable 5 มีความสามารถในการประมวลผลข้อความยาวได้ไม่ดีนัก

คำวิจารณ์ส่วนใหญ่มุ่งเน้นไปที่การลดคุณภาพของโมเดล (model degradation)

ปัจจุบัน Fable 5 มีราคา API อยู่ที่ 10 ดอลลาร์สหรัฐต่อล้านโทเค็นอินพุต และ 50 ดอลลาร์สหรัฐต่อล้านโทเค็นเอาต์พุต

เมื่อเปรียบเทียบแบบแนวนอน ราคานี้ประมาณสองเท่าของ Opus 4.8 และมากกว่าสามเท่าของ Sonnet 4.6 ต้นทุนจริงของกระบวนการทำงานที่ซับซ้อนเพียงกระบวนการเดียวสูงกว่าโมเดล Claude รุ่นก่อนหน้านี้อย่างเห็นได้ชัด
นอกจากนี้ ความไวของโมเดลก็ถูกปรับเพิ่มขึ้นด้วย: ระบบมีแนวโน้มที่จะระมัดระวังมากขึ้น โดยเลือกที่จะทำให้เกิดข้อผิดพลาดมากกว่าที่จะเสี่ยงและหาความมั่นคงก่อน
เพื่อแก้ไขปัญหาเรื่องต้นทุนที่สูงเกินไป ฉันได้รวบรวมข้อมูลการทดสอบจากผู้ใช้งานมาให้ ซึ่งไม่เพียงแต่จะช่วยประหยัดเงินของทุกคน แต่ยังให้ผลลัพธ์ที่ดีอีกด้วย นี่คือวิธีการใช้โมเดลร่วมกัน:
ใน IDE ที่รองรับโมเดลผสมผสานอย่าง Cursor คุณสามารถใช้โมเดลต่างๆ บนแพลตฟอร์มได้ในขั้นตอนต่างๆ:
ขั้นตอนที่ 1: การตรวจสอบโค้ดและการวิเคราะห์โครงการเบื้องต้น เพื่อเตรียมความพร้อมในการทำความเข้าใจโครงสร้างของโปรเจกต์ ใช้ GPT-5.5, High, MiniMax, M3, Kimi, K2.6 หรือ Composer 2.5 อย่างใดอย่างหนึ่ง
ขั้นตอนที่ 2: การจัดทำแผนโครงการ โดยใช้ GPT-5.5 (Very High) หรือ Opus 4.8 เพื่อเตรียมแผนการดำเนินงานของโปรเจกต์
ขั้นตอนที่สาม: การวิเคราะห์แผนโครงการ ใช้ Fable 5 เพื่อตรวจสอบแผนโครงการและหาส่วนที่อาจมีข้อผิดพลาด หากจำเป็นต้องแก้ไขแผน ให้ใช้ GPT-5.5 (ระดับ Very High)
ขั้นตอนที่สี่: การดำเนินการและการใช้แผนโครงการ ใช้ MiniMax, M3, DeepSeek, V4, Max, Composer 2.5 หรือ Sonnet 4.6 เพื่อทำตามแผนที่วางไว้
ขั้นตอนที่ห้า: การตรวจสอบครั้งสุดท้าย ใช้ GPT-5.5 (ระดับ High) เพื่อตรวจสอบผลลัพธ์สุดท้ายของการเขียนโค้ดและดูว่าการดำเนินการนั้นสอดคล้องกับแผนเดิมหรือไม่
การใช้พลังที่มีราคาแพงในที่ที่เหมาะสมที่สุดคือวิธีที่ถูกต้องในการเล่น Fable 5
Claude Fable 5 ว่ามันทำให้คุณ “บ้า” หรือไม่นั้น แต่ละคนมีความคิดเห็นต่างกันไป
แต่เมื่อคุณมีมันแล้ว อัตราการใช้ Token นั้นชัดเจนมาก มันจริงๆ แล้วทำให้คุณ “บ้า”
บทความนี้มาจาก WeChat Official Account “JackCui” โดยผู้เขียน “JackCui”
ลิงก์บทความ:https://airai.cc/th/%E6%9C%AA%E5%91%BD%E5%90%8D/7/
มีประโยชน์หรือไม่?