Menu

GPT-5.6 adalah batch pertama dari pengukuran aktual! Sniper yang tepat Mythos

Baru saja, Anthropic merilis “The Big Killer” yang telah disimpan selama dua bulan—Claude Fable 5danMythos 5, seperti melemparkan sebuah bom.


Sekarang ini langsung memberikan tekanan kepada OpenAI.



Pada waktu yang sama, GPT-5.6 juga bocor.


OpenAI telah mulai menguji kode internalnya sejak minggu lalu.keplerdankindleDua titik pemeriksaan baru. Kindle-alpha telah dipilih sebagai kandidat untuk dirilis.



Versi uji coba internal dari GPT-5.6 mulai banyak diuji oleh para pengembang di luar negeri dan komunitas yang membagikan informasi secara tidak resmi (leak). Kode sumber, versi yang diusulkan, serta pengalaman penggunaan perangkat tersebut telah tersebar ke publik.



Baik dalam persaingan untuk mendapatkan izin IPO (Initial Public Offering) maupun ketika model utama kedua perusahaan saling bertabrakan, kedua perusahaan tersebut berkata, “Aku juga akan mengajukan permohonanmu, dan kamu mengeluarkan model baru, aku juga akan mengeluarkan model baru.”


Kejernihan berarti pertarungan yang tidak bisa dihentikan.


Tapi pertanyaannya adalah, apakah GPT-5.6 benar-benar bisa mengalahkan Mythos??



GPT-5.6 muncul ke permukaan.


Sejauh ini, OpenAI telah melawan GPT-5.6, dan belum ada pengumuman resmi sama sekali; versi tersebut belum dirilis secara resmi.


Namun, banyak netizen dari luar negeri telah mengungkapkan bahwa pengujian “titik pemeriksaan internal” (internal checkpoint) telah selesai.


Yang disebut titik pemeriksaan (checkpoint) adalah snapshot parameter yang disimpan oleh model pada suatu titik waktu selama proses pelatihan.


Di dalam OpenAI, ada banyak versi dari model tersebut, dan mereka membandingkannya secara horizontal, lalu memilih salah satu versi yang “cukup baik untuk dirilis” sebagai versi kandidat (release candidate/RC).


Mulai minggu lalu, OpenAI sedang menguji dua titik pemeriksaan (checkpoint) baru secara internal, dengan kode nama Kindle dan Kepler. Di antaranya...kindle-alphaVersi cadangan telah dipilih untuk diterbitkan.



Dari informasi yang bocor, peningkatan yang paling sering disebutkan dalam GPT-5.6 kali ini adalahMenghasilkan antarmuka pengguna (Frontend/UI)。


Menurut Pankaj Kumar, penggunaan Kindle telah sangat meningkatkan kemampuan generasi kode frontend (front-end generation) dari alfa.Kita dapat langsung menghasilkan tampilan antarmuka yang lebih kuat, tanpa memerlukan kata-kata petunjuk yang rumit atau keterampilan tambahan.。



Selain itu, kemampuan visualnya juga sangat baik, dengan kinerja yang baik dalam tugas-tugas pemahaman dan penggunaan gambar, serta terdapat peningkatan yang signifikan dalam hal penalaran, pengkodean, dan generasi antarmuka pengguna (UI).


Ini adalah hasil pengukuran yang dilakukan oleh netizen Chris terhadap Kindle, menggunakan pengaturan kecepatan (gaya) “medium”:



Ini adalah hasil pengukuran yang dilakukan oleh seorang netizen lain sebelumnya di versi non-reasoning dari Joule:



Yang pertama tampaknya jauh lebih mewah.


Namun, netizen Leo menggunakan prompt yang sama, alat pengukur Kepler, dan Kindle untuk melakukan pengukuran pada tingkat xhigh masing-masing.


Dibandingkan dengan Kepler, ditemukan bahwa Kindle masih mengalami penurunan kualitas.



Hmm... Efek seperti ini benar-benar sulit untuk dinilai.


Dia bahkan memperkirakan bahwa OpenAI kemungkinan besar akan terus menyempurnakan (produk atau teknologinya),Tidak menutup kemungkinan bahwa Kindle akan dihilangkan dari daftar pilihan sebagai versi yang dipertimbangkan.。


Berita terbaru adalah bahwa Kindle telah dikeluarkan dari Arena, dan model baru telah muncul.Levi。


Ada netizen yang menduga bahwa “Levi” mungkin juga merupakan kode nama untuk versi internal dari “GPT-5.6”, dan mereka membandingkannya dengan kemampuan front-end dari “GPT-5.5”:



Dari sini dapat dilihat bahwa frontend dari Levi juga cukup baik, dengan gaya yang segar dan sederhana, serta memiliki kesan yang elegan. Penanganan detailnya juga sangat baik.


Namun, beberapa netizen menemukan bahwa Levi mungkin berasal dari Meta, bukan dari GPT-5.6.



Jadi, apakah GPT-5.6 benar-benar bisa mengalahkan Mythos?


Pengguna internet mark_k mengklaim bahwa GPT-5.6 "beberapa agen berhasil mengalahkan benchmark pemrograman Mythoss".



Namun, yang lebih meyakinkan saat ini adalah hasil pengujian nyata dari netizen Leo yang ditampilkan sebelumnya. Dia berpendapat bahwa situasi dengan GPT-5.6 tidaklah menggembirakan:


Dibandingkan dengan Kepler, Kindle merupakan sebuah kemunduran. Dalam bentuknya yang sekarang,Mudah dikalahkan oleh Mythos。


Pada bulan Juni, ketiga keluarga besar tersebut mengadakan pertunjukan "Speed and Passion".


Bulan Juni, musim panas tiba, dan komunitas model besar juga menjadi semakin ramai.


Waktu rilis dari tiga model AI terkemuka di luar negeri bertepatan: Fable 5, Gemini 3.5 Pro, dan GPT-5.6, menciptakan sebuah “pertarungan hidup dan mati” yang sengit.


Dan yang dimainkan adalah serangkaian kemampuan yang sama: penalaran, agen cerdas (agent), pengkodean, dan generasi antarmuka pengguna (front-end generation).


Yang menarik adalah, meskipun ketiga perusahaan tersebut semuanya menumpukan beban pada node tersebut pada bulan Juni,Sejauh ini, hanya perusahaan A yang benar-benar menyerahkan tugasnya.。


Gemini 3.5 Pro diluncurkan pada konferensi Google I/O pada tanggal 19 Mei, dengan fokus pada pemrosesan konteks yang mencakup hingga 2 juta token, serta kemampuan penalaran berbasis teknologi Deep Think.


Namun, fitur tersebut belum resmi diluncurkan; pihak berwenang menetapkan bahwa akan tersedia secara resmi pada bulan Juni.


GPT-5.6, Berita tersebut diumumkan pada akhir bulan ini.


Ini juga menambah ketegangan pada situasi OpenAI: lawan sudah mengumumkan skor mereka, dan di dalam mungkin masih mempertimbangkan versi RC mana yang sebaiknya dikirimkan.


Tapi selain melakukan pengukuran kinerja (performa),HargaJuga merupakan faktor yang penting.


Fable5.Mythos5 Harga yang disepakati secara seragam adalahToken10Dolar Amerika,Token50Dolar Amerika.


Kira-kira dua kali lipat dari Opus yang ada saat ini.


Jika GPT-5.6 memiliki kemampuan yang setara dengan Mythos atau bahkan sedikit lebih rendah, tetapi harganya jauh lebih murah, maka masih ada kemungkinan bagi produk tersebut untuk meningkatkan tingkat penggunaan aktual di sebuah kota~


Saat ini, OpenAI belum mengeluarkan pengumuman resmi, dan duel yang sebenarnya akan ditunggu hingga versi resmi dari GPT-5.6 dan Fable mendapatkan skor secara langsung.


Kemungkinan besar hasilnya akan terlihat bulan ini, tunggu saja dengan penuh harapan~


Referensi Tautan:

[1]https://x.com/mark_k/status/2063922897341567488?s=20

[2]https://x.com/AiBattle_/status/2064078302394917157?s=20

[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20

[4]https://x.com/synthwavedd/status/2063245096951160865?s=20

[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20

[6]https://x.com/koltregaskes/status/2062806155139912164?s=20


Penulis berasal dari "Quantum Bit" dengan nama "Ting Yu".

Apakah ini membantu?

Dukungan teknisDukungan langsung
侧栏
Kembali ke atas
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR