Menu

Claude Fable 5 lời nhắc rò rỉ, 6 giờ hiệu quả thực sự kiểm tra, thực sự giết điên?

Fable 5 vừa mới được ra mắt, và ngay lập tức các từ khóa liên quan đến hệ thống đã bị rò rỉ:



Sau khi xem những từ khóa này, có một vài điểm rất quan trọng cần lưu ý:


  • Đầu tiên, Fable đã bổ sung API lưu trữ dữ liệu lâu dài (window.storage) cho Artifact. Artifact chính là những nội dung độc đáo được tạo ra bởi mã nguồn Claude, như các trang HTML, component React, v.v. Trước đây, dữ liệu Artifact không thể được lưu trữ, và chúng giống như những bản demo chỉ sử dụng một lần. Bây giờ, dữ liệu có thể được lưu giữ giữa các phiên (session), hỗ trợ các công cụ có “trí nhớ”, như bảng xếp hạng, máy đánh dấu thời gian, nhật ký, v.v.


  • Thứ hai, Fable đã hoàn thiện toàn bộ logic của bộ kết nối MCP App. Nếu bạn muốn kết nối với các dịch vụ bên ngoài (đặt hàng, taxi, âm nhạc, v.v.), Fable sẽ trước tiên kiểm tra danh mục dịch vụ có sẵn, sau đó đưa các tùy chọn đó cho bạn xác nhận. Đặc biệt đối với những dịch vụ yêu cầu thanh toán, Fable đã thiết lập một loạt quy định chi tiết về việc đồng ý sử dụng dịch vụ (opt-in).


Và:


  • Thứ ba, khi Fable nhận diện được các yêu cầu về bảo mật mạng, sinh hóa học và chưng cất, nó sẽ tự động chuyển giao phản hồi cho mô hình có hiệu suất thấp hơn là Opus 4.8 để xử lý và thông báo cho người dùng về việc giảm cấp độ dịch vụ.


  • Thứ tư, Fable có thêm một tính năng mới là long_conversation_reminder (nhắc nhở về cuộc trò chuyện dài). Khi một cuộc trò chuyện trở nên quá dài, Fable sẽ thêm một thông báo nhắc nhở vào cuối thông tin người dùng, nhằm nhắc nhở mô hình không quên nội dung cuộc trò chuyện ban đầu, vì cuộc trò chuyện đã kéo dài quá lâu.


Liên kết kho lưu trữ:


https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/CLAUDE-FABLE-5.md


Mặc dù việc Mythos bị giảm chức năng cho mục đích sử dụng dân dụng đã được dự đoán trước đó, nhưng từ những thông báo trong hệ thống này, vẫn có thể thấy rằng Anthropic rất coi trọng vấn đề bảo mật.


Đáng chú ý là, trong các điều khoản hành vi của Fable, phần về sức khỏe tâm thần chiếm một không gian khá lớn. Khi kết hợp với các vụ kiện liên quan đến robot trò chuyện tự tử trong khoảng một hoặc hai năm qua, không khó để hiểu tại sao phần này được viết một cách chi tiết đến vậy...


Đây là bản dịch của đoạn văn trên sang tiếng Việt: Đây là bản dịch của đoạn văn trên sang tiếng Việt.



Bản dịch như sau:


Claude quan tâm đến sức khỏe thể chất và tinh thần của mọi người, và tránh khuyến khích hoặc thúc đẩy những hành vi tự hủy hoại bản thân như nghiện ngập, tự làm tổn thương bản thân, rối loạn ăn uống hoặc tập thể dục/không có lối sống lành mạnh, cũng như những suy nghĩ tiêu cực quá mức hoặc sự tự chỉ trích bản thân.

Ngay cả khi người dùng yêu cầu một cách chủ động, Claude vẫn có thể tránh tạo ra những nội dung có thể hỗ trợ hoặc làm tăng thêm nguy cơ tự hủy diệt.

Khi trò chuyện với những người có ý định tự tử hoặc xu hướng tự gây thương tích về “các biện pháp hạn chế nguy hiểm” hoặc “kế hoạch an toàn”, Claude không bao giờ đề cập cụ thể tên người, liệt kê hoặc mô tả chi tiết. Ngay cả khi muốn cảnh báo họ tránh xa những thứ nguy hiểm, Claude cũng không nói ra trực tiếp, bởi vì việc nhắc đến những điều đó có thể vô tình kích động họ.


Vậy hãy cùng xem kết quả thử nghiệm thực tế của Fable 5 nhé.


Đây là một demo mà người dùng đã sao chép từ Fable 5 và Ancient Scrolls:



Fable gọi cảnh rừng 3D được xây dựng bởi ThreeJ:



Có khả năng mô phỏng không gian với 5000 vật thể:



Trình diễn tầm nhìn đô thị New York:


Thành phố Gothic bị những con sóng nuốt chửng:



Người dùng mạng Victor Taelin đã sử dụng một dự án thực tế để thực hiện việc kiểm thử.



HVM5Đó là một hệ thống cơ bản liên quan đến tính toán hiệu năng cao. Trước đây, anh ấy đã từng sử dụng nó. 32 cáiGPT-5Agent đã chạy trong khoảng 20 giờ; mặc dù tốc độ được tăng lên gấp 2 lần, nhưng chất lượng mã nguồn bị suy giảm do sự phình to của mã nguồn. Sau đó, Opus 4.8 được phép sử dụng.GPT-5.5Tối ưu hóa trong 8 giờ, Opus cho thấy mức tăng tốc độ xử lý từ 6% đến 34%; kết quả từ GPT còn tốt hơn, nhưng tệp tin đó không thể được sử dụng.



Kết quả, Fable 5 chỉ mất 2 giờ để hoàn thành công việc, và chỉ có một bài kiểm tra (benchmark) đạt mức tăng trưởng 1770%, trong khi 4 bài kiểm tra khác tăng trưởng trên mức trung bình khoảng 100% đến 22%.


Phản ứng đầu tiên của mọi người là không tin, nghi ngờ rằng đó có phải là một bài kiểm tra hiệu năng (benchmark) được “đóng kèm sẵn” (hard-coded) hay không, bởi trước đây họ đã từng bị các công cụ như GPT lừa dối về vấn đề này.



Sau khi đọc phần giải thích, anh ấy nhận ra rằng hướng tối ưu hóa cho Fable thực sự hợp lý.


Vì HVM5 xử lý các nút so khớp mẫu động (dynamic pattern-match), nhiều nhánh không cần thiết cũng bị đưa vào quá trình thu gom rác (garbage collection), gây lãng phí rất nhiều thời gian. Trước đây, người dùng chỉ tối ưu hóa các trường hợp so khớp tĩnh (static match), còn các trường hợp so khớp động thì không được tối ưu hóa. Fable đã phát hiện ra điểm này, vì vậy kết quả trong các bài kiểm thử trở nên quá mức (rất ấn tượng).


Đây là phân tích nguyên nhân lỗi HVM5 do Fable 5 cung cấp:



Người dùng mạng xã hội Thổ Nhĩ Kỳ Alican Kiraz đã thực hiện một loạt các bài kiểm tra so sánh giữa Fable 5 và GPT 5.5.


Kết luận của anh ấy là Fable 5 đã được chạy thử, và việc này tốn rất nhiều tiền: 360,55 đô la Mỹ; trong khi GPT-5.5 chỉ tốn 6 đô la Mỹ. Tuy nhiên, nếu xét về các chi tiết được tối ưu hóa, Fable 5 thực sự đã thực hiện những cải tiến ở cấp độ sâu hơn, mang tính chất chuyên nghiệp hơn, và phản ánh tốt hơn tư duy của các kỹ sư về hiệu năng.



Đây là kết luận của anh ấy từ cuộc thử nghiệm:



The programming capabilities of Fable 5 are really strong, as tested by real tasks using the third-party programming tool Augment Code.


Cả hai đã thực hiện 489 nhiệm vụ lập trình, và Fable 5 có màn trình diễn tổng thể cũng như độ chính xác vượt trội hơn rõ rệt, với tổng điểm cao hơn 0.224 và độ chính xác cao hơn 0.191.



Tuy nhiên, cũng có những trường hợp thực tế gây thất vọng. Một người dùng mạng tên Ryan R. Hughes đã gửi một bản đề xuất sửa đổi (PR) lớn gồm 74 tệp tin để Fable 5 xem xét. Kết quả là quá trình xử lý mất tới hơn 34 phút và tiêu tốn 42% thời lượng cuộc trò chuyện Claude Code trong vòng 5 giờ, chỉ để đưa ra 16 phát hiện (những lỗi cần sửa).



Những ví dụ như vậy không hề hiếm gặp, Fable 5 có vẻ hơi đắt một chút.



Một số người cho rằng, sau khi kiểm tra thực tế, khả năng phân tích văn bản dài của Fable 5 khá yếu:



Nhiều phản hồi tiêu cực hơn tập trung vào thao tác giảm cấp mô hình:



Hiện tại, giá API của Fable 5 là 10 đô la Mỹ cho mỗi triệu token đầu vào và 50 đô la Mỹ cho mỗi triệu token đầu ra.



So sánh theo chiều ngang, giá của sản phẩm này gấp khoảng hai lần so với Opus 4.8 và hơn ba lần so với Sonnet 4.6. Chi phí thực tế cho một luồng công việc phức tạp duy nhất cao hơn đáng kể so với bất kỳ thế hệ mô hình Claude nào trước đây.


Và độ nhạy của nó cũng đã được tăng lên: toàn bộ hệ thống bảo vệ trở nên thận trọng hơn, thà có thể làm tổn thương người dùng nhầm lẫn còn hơn là chọn phương án an toàn nhất trước.


Để giải quyết vấn đề chi phí quá cao, tôi đã thu thập các phương pháp thử nghiệm từ người dùng mạng, những phương pháp này không chỉ giúp mọi người tiết kiệm tiền mà còn mang lại hiệu quả rất tốt. Đây là giải pháp sử dụng kết hợp nhiều mô hình:


Trong các IDE hỗ trợ mô hình hỗn hợp như Cursor, các mô hình khác nhau có thể được sử dụng trên nền tảng theo từng giai đoạn:

Giai đoạn đầu tiên: Kiểm tra mã nguồn và phân tích sơ bộ dự án, nhằm chuẩn bị bối cảnh và tìm hiểu cấu trúc của dự án. Có thể sử dụng công cụ GPT-5.5, MiniMax M3, Kimi K2.6 hoặc Composer 2.5.

Giai đoạn thứ hai: Xây dựng kế hoạch dự án, sử dụng GPT-5.5 Very High hoặc Opus 4.8 để chuẩn bị kế hoạch dự án.

Giai đoạn thứ ba: Phân tích kế hoạch dự án Sử dụng Fable 5 để xem xét kế hoạch dự án và tìm ra những phần có thể có lỗi. Nếu cần thay đổi kế hoạch, hãy sử dụng GPT-5.5 (mức độ ưu tiên rất cao).

Giai đoạn thứ tư: Thực hiện và sử dụng kế hoạch dự án bằng cách triển khai các công cụ MiniMax M3, DeepSeek V4, Max, Composer 2.5 hoặc Sonnet 4.6 theo kế hoạch đã đề ra.

Giai đoạn thứ năm: Kiểm tra cuối cùng, sử dụng mã GPT-5.5 để xem xét kết quả cuối cùng của quá trình kiểm tra mã, và đảm bảo rằng việc triển khai phù hợp với kế hoạch ban đầu.


Sử dụng sức mạnh đắt tiền ở đúng nơi chính là cách chơi Fable 5 một cách hiệu quả nhất.


Hiệu quả của việc sử dụng Claude Fable 5 để tiêu diệt những kẻ điên loạn là điều mà người nhân từ và người khôn ngoan có những quan điểm khác nhau.


Nhưng với nó, tốc độ tiêu thụ Token rất rõ ràng, thực sự là điên rồ.



Bài viết này được đăng trên WeChat Public Account “JackCui”, tác giả là “JackCui”.

Thông tin này có hữu ích không?

Hỗ trợ kỹ thuậtHỗ trợ trực tuyến
Về đầu trang
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR