Menu

GPT-5.6 Đợt thử nghiệm đầu tiên đã đến! bắn tỉa chính xác Mythos

Vừa rồi, Anthropic đã công bố “kẻ sát thủ lớn” mà họ đã ẩn giấu trong hai tháng…Claude Fable 5VàMythos 5Giống như việc ném một quả bom.


Bây giờ hãy áp lực trực tiếp lên OpenAI.



Cùng một lúc đó, GPT-5.6 cũng bị rò rỉ.


OpenAI đã bắt đầu thử nghiệm mã nguồn nội bộ từ tuần trước.keplerVàkindleHai điểm kiểm soát mới. Kindle-alpha đã được chọn làm ứng cử viên cho việc phát hành.



Phiên bản thử nghiệm nội bộ của GPT-5.6 bắt đầu được các nhà phát triển ở nước ngoài và những người chia sẻ thông tin trên mạng đánh giá một cách tích cực. Mã nguồn, các phiên bản dự thảo, và thông tin liên quan đến trải nghiệm sử dụng sản phẩm đều đã được công bố.



Dù là trong cuộc cạnh tranh để được phát hành cổ phiếu lần đầu (IPO) hay khi các mẫu sản phẩm chủ lực của hai công ty va chạm với nhau, họ đều có thái độ “Tôi cũng sẽ nộp đơn của mình, bạn phát hành mẫu mới, tôi cũng sẽ phát hành mẫu mới”.


Sự trong sạch chính là khi mọi thứ trở nên hỗn loạn đến mức không thể kiểm soát được.


Nhưng vấn đề là, liệu GPT-5.6 có thực sự có thể đánh bại được Mythos không??



GPT-5.6 đã xuất hiện trên mặt nước.


Cho đến nay, OpenAI đã đối đầu với GPT-5.6, nhưng vẫn chưa có bất kỳ thông báo chính thức nào từ phía họ, và nó cũng chưa được công bố một cách chính thức.


Tuy nhiên, nhiều người dùng mạng ở nước ngoài vẫn chưa công bố rằng các bài kiểm thử bằng công cụ “điểm kiểm soát nội bộ” (internal checkpoints) đã được hoàn thành.


Cái gọi là điểm kiểm soát (checkpoint) là bản sao các tham số của mô hình được lưu lại tại một thời điểm nhất định trong quá trình huấn luyện.


Trong nội bộ OpenAI, sẽ có rất nhiều phiên bản được so sánh với nhau, và sau đó một phiên bản được chọn vì “đủ tốt để được phát hành” sẽ được gọi là phiên bản dự thảo phát hành (Release Candidate – RC).


Từ tuần trước, OpenAI đã bắt đầu thử nghiệm hai điểm kiểm soát mới bên trong, với tên mã là Kindle và Kepler. Trong đókindle-alphaPhiên bản dự thảo đã được chọn để phát hành.



Dựa trên thông tin cảm giác thể chất được thu thập từ dòng dữ liệu đang chảy ra,GPT-5.6Lần nâng cấp được đề cập nhiều nhất lần này làTạo giao diện người dùng/trước end (Frontend/User Interface)。


Theo lời của người dùng mạng Pankaj Kumar, Kindle đã nâng cao đáng kể khả năng tạo ra giao diện người dùng (frontend generation) của Alpha.Có thể trực tiếp tạo ra giao diện hiển thị mạnh mẽ hơn, mà không cần đến các từ khóa hướng dẫn phức tạp hay kỹ năng bổ sung.。



Ngoài ra, khả năng nhìn thấy của nó cũng rất tốt, thể hiện xuất sắc trong các nhiệm vụ hiểu hình ảnh và trích dẫn hình ảnh, đồng thời đã có những cải thiện đáng kể về mặt suy luận, mã hóa và tạo giao diện người dùng (UI).


Đây là kết quả đo lường của người dùng mạng Chris về hiệu suất của Kindle khi sử dụng chế độ độ sáng trung bình (medium):



Đây là kết quả mà một người dùng khác đã đo được trước đây trên phiên bản Joule không chứa chức năng suy luận:



Có thể thấy cái trước đẹp tinh xảo hơn nhiều.


Nhưng người dùng mạng Leo đã sử dụng cùng một prompt, Kepler và Kindle để đo lường ở các mức xhigh khác nhau.


So với Kepler, có thể thấy Kindle vẫn đang tụt hậu.



Ừm... Thật khó để đánh giá hiệu quả của điều này.


Anh ấy thậm chí còn cho rằng OpenAI rất có thể sẽ tiếp tục cải thiện và hoàn thiện sản phẩm của mình.Không loại trừ khả năng cuối cùng Kindle sẽ không được sử dụng nữa như một phiên bản đề xuất (candidate version).。


Tin mới nhất là, Kindle đã bị loại khỏi danh sách các sản phẩm được cung cấp tại Arena, và một mẫu mới đã được ra mắt.Levi。


Có một số người dùng đoán rằng Levi cũng có thể là…GPT-5.6Mã định danh cho phiên bản nội bộ, và kết hợp nó vớiGPT-5.5So sánh về khả năng phía trước (front-end) của các công cụ:



Như vậy có thể thấy, giao diện người dùng (frontend) của Levi cũng khá tốt, phong cách trẻ trung và đơn giản, mang lại cảm giác sang trọng, và việc xử lý các chi tiết cũng rất tinh tế.


Tuy nhiên, một số người dùng đã phát hiện ra rằng Levi có thể đến từ Meta, chứ không phải từ GPT-5.6.



Vậy, GPT-5.6 có thể đánh bại được Mythos không?


Người dùng mạng mark_k tuyên bố rằng, theo GPT-5.6, “nhiều agentic đã đánh bại các tiêu chuẩn lập trình của Mythoss”.



Tuy nhiên, điều thuyết phục hơn hiện nay là kết quả thử nghiệm thực tế của người dùng mạng Leo mà chúng ta đã trình bày trước đó. Anh ấy cho rằng tình hình của GPT-5.6 không mấy khả quan:


So với Kepler, Kindle là một bước lùi. Với hình thức hiện tại của nó,Rất dễ bị Mythos đánh bại。


Tháng Sáu, ba gia tộc quyền lực tổ chức sự kiện “Tốc độ và Đam mê”


Tháng Sáu, mùa hè đã đến, và cộng đồng các mô hình lớn (big models) cũng trở nên sôi động hơn.


Thời điểm các mô hình AI hàng đầu trên thế giới được công bố đều trùng hợp nhau: Fable 5, Gemini 3.5 Pro, và GPT-5.6, tạo nên một “cuộc đua sinh tử” đầy kịch tính.


Và họ đang chơi với cùng một nhóm các khả năng: suy luận, các đại lý trí tuệ (agents), lập trình, và tạo ra giao diện người dùng (front-end generation).


Điều thú vị là, mặc dù cả ba công ty đều tập trung vào các nút (nodes) đó vào tháng 6, nhưngCho đến nay, chỉ có công ty A là đã thực sự nộp bài thi.。


Gemini 3.5 Pro đã được công bố tại hội nghị Google I/O vào ngày 19 tháng 5, tập trung vào khả năng xử lý 2 triệu token và các thuật toán suy luận loại Deep Think.


Nhưng nó vẫn chưa được chính thức ra mắt; theo kế hoạch, nó sẽ có sẵn cho sử dụng vào tháng 6.


GPT-5.6, thông báo cho biết nó sẽ được công bố vào cuối tháng này.


Điều này cũng làm tăng thêm sự căng thẳng cho tình hình của OpenAI: đối thủ đã công bố điểm số của họ, và bên trong có lẽ vẫn đang tranh luận xem nên gửi phiên bản RC nào.


Nhưng ngoài việc đo điểm hiệu năng (đánh giá hiệu suất hệ thống),Giá cảĐây cũng là một yếu tố quan trọng.


Fable5.Mythos5 Định giá thống nhấtToken10Đô la Mỹ,Token50Đô la Mỹ.


Khoảng gấp đôi so với Opus hiện tại.


Nếu GPT-5.6 có khả năng ngang bằng hoặc thậm chí hơi kém hơn Mythos, nhưng giá cả lại rẻ hơn nhiều, thì nó vẫn có thể giúp tăng tỷ lệ sử dụng thực tế ở một thành phố nào đó~


Hiện tại, OpenAI vẫn chưa đưa ra thông báo chính thức; cuộc đối đầu thực sự sẽ phải chờ đến khi phiên bản chính thức của GPT-5.6 và Fable được thử nghiệm trực tiếp với nhau.


Có lẽ kết quả sẽ được công bố vào tháng này, hãy cùng chờ đợi nhé~


Các liên kết tham khảo:

[1]https://x.com/mark_k/status/2063922897341567488?s=20

[2]https://x.com/AiBattle_/status/2064078302394917157?s=20

[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20

[4]https://x.com/synthwavedd/status/2063245096951160865?s=20

[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20

[6]https://x.com/koltregaskes/status/2062806155139912164?s=20


Tác giả đến từ “Quantum Bit” và có tên là “Nghe Mưa”.

Thông tin này có hữu ích không?

Hỗ trợ kỹ thuậtHỗ trợ trực tuyến
侧栏
Về đầu trang
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR