Menu

GPT-5.6 è arrivato il primo test! Sniper di precisione Mythos

Poco fa, Anthropic ha rilasciato il suo “grande assassino”, che era stato nascosto per due mesi…Claude Fable 5EMythos 5È come lanciare una bomba.


Ora esercitiamo direttamente pressione su OpenAI.



Nello stesso momento, anche GPT-5.6 è stato rivelato.


OpenAI ha iniziato a testare il codice interno la scorsa settimana.keplerEkindleDue nuovi punti di controllo. La versione Kindle-alpha è stata selezionata come candidata per il rilascio.



La versione di test interna di GPT-5.6 ha iniziato a essere ampiamente testata tra gli sviluppatori all’estero e nei circoli di persone che condividono informazioni tecniche (leakers). Il codice, le versioni candidate e i dati relativi alle prestazioni del dispositivo sono stati tutti resi pubblici.



Sia che si tratti di competere per un IPO (Initial Public Offering) sia di un incidente tra i modelli di punta, entrambe le aziende dicono: “Anch’io presenterò la mia domanda, così come la tua”; “Se tu lanci un nuovo modello, anch’io lo farò”.


La purezza significa essere così impegnati in una lotta che non si può smettere.


Ma il problema è: GPT-5.6 riuscirà davvero a superare Mythos??



“GPT-5.6” è emerso in superficie.


Fino ad ora, OpenAI ha affrontato GPT-5.6 senza alcuna dichiarazione ufficiale, e non è ancora stato rilasciato formalmente.


Tuttavia, molti utenti di internet all'estero non hanno ancora reso noto che i test con i probe dei “punti di controllo interni” sono stati completati.


Un cosiddetto “punto di controllo” (checkpoint) è uno snapshot dei parametri di un modello memorizzato in un determinato momento durante il processo di addestramento.


All'interno di OpenAI ci saranno molte versioni del prodotto, che verranno confrontate tra loro. Successivamente, verrà scelta una versione che sia "abbastanza buona da poter essere pubblicata", e questa verrà chiamata versione candidata alla pubblicazione (Release Candidate, RC).


Da la scorsa settimana, all’interno di OpenAI sono in corso dei test su due nuovi punti di controllo, con i nomi in codice “kindle” e “kepler”. Tra questi…kindle-alphaLa versione candidata è stata selezionata e pubblicata.



Dai dati emessi riguardo alla sensazione corporea, l'aggiornamento più spesso menzionato in questa occasione da GPT-5.6 èGenerazione di frontend/UI。


Secondo quanto affermato dal netizen Pankaj Kumar, il Kindle ha notevolmente migliorato le capacità di generazione del front-end di Alpha.È possibile ottenere un output grafico più efficace e attraente direttamente, senza la necessità di utilizzare parole di incoraggiamento complesse o competenze aggiuntive.。



Inoltre, le sue capacità visive sono molto buone, mostrando prestazioni eccellenti in compiti di comprensione e utilizzo di immagini, nonché miglioramenti significativi in termini di ragionamento, codifica e generazione di interfacce utente (UI).


Questo è il risultato delle misurazioni effettuate dal netizen Chris sul Kindle, utilizzando la velocità di lettura a livello “medium”:



Ecco l’effetto misurato da un altro utente su Joule, nella versione non dedicata alla ragionamento:



Si può notare che il primo esempio è molto più raffinato.


Ma l’utente Leo ha utilizzato lo stesso prompt, Kepler e Kindle per effettuare le misurazioni rispettivamente nella categoria “xhigh”.


Rispetto a Kepler, si è scoperto che il Kindle sta ancora regredendo.



Ehm... Questo effetto è davvero difficile da valutare.


Lui ha persino giudicato che OpenAI molto probabilmente continuerà a perfezionarsi,Non si esclude l’eventualità che in futuro il Kindle venga scartato come candidato per l’utilizzo.。


Le ultime notizie sono che il Kindle è stato rimosso dall’Arena e ne è apparso un nuovo modello.Levi。


Alcuni utenti hanno ipotizzato che “Levi” possa anche essere il codice di una versione interna di “GPT-5.6”, e hanno confrontato le sue funzionalità con quelle offerte da “GPT-5.5” dal punto di vista dell’interfaccia utente:



Da ciò si può vedere che anche il front-end di Levi è piuttosto buono: ha uno stile fresco e semplice, con un tocco di eleganza, e i dettagli sono stati curati con attenzione.


Tuttavia, alcuni utenti hanno scoperto che Levi potrebbe provenire da Meta, e non da GPT-5.6.



Allora, GPT-5.6 riuscirà davvero a battere Mythos?


Il netizen mark_k afferma che GPT-5.6 “molti agenti hanno superato i benchmark di codifica di Mythoss”.



Tuttavia, al momento più convincente è il test effettuato dal netizen Leo, mostrato in precedenza. Lui ritiene che la situazione relativa a GPT-5.6 non sia molto promettente:


Rispetto a Kepler, il Kindle rappresenta un passo indietro. Nella sua forma attuale,È facile essere sconfitto da Mythos.。


A giugno, le tre famiglie reali mettono in scena “Fast and Furious”


Giugno, arriva l'estate, e anche il mondo dei grandi modelli (big models) inizia a scaldarsi.


I tempi di rilascio dei tre principali modelli di intelligenza artificiale all’estero sono coincisi: Fable 5, Gemini 3.5 Pro e GPT-5.6, offrendo uno spettacolo davvero emozionante.


E inoltre, si utilizza lo stesso insieme di capacità: ragionamento, agenti intelligenti, codifica, generazione di interfaccia utente front-end.


È interessante notare che, nonostante le tre aziende abbiano tutte concentrato i loro sforzi su questo aspetto a giugno,Fino ad ora, l'unica azienda che ha effettivamente consegnato i lavori è stata la Società A.。


Gemini 3.5 Pro è stato presentato al Google I/O del 19 maggio, concentrandosi su contesti di circa 2 milioni di token e sulle capacità di ragionamento di tipo Deep Think.


Ma non è ancora stato ufficialmente lanciato; l’uscita è prevista per giugno.


GPT-5.6, la notizia è stata diffusa per essere pubblicata più tardi questo mese.


Questo aggiunge anche una certa tensione alla situazione di OpenAI: l’avversario ha già pubblicato i punteggi, e all’interno potrebbero ancora esserci dibattiti su quale versione RC dovrebbe essere inviata.


Ma oltre a fare i test di prestazioni (run the benchmarks),PrezziÈ anche un fattore importante.


Fable5.Mythos5 Prezzo unificatoToken10Dollari,Token50Dollari.


Rappresenta circa il doppio dell’attuale Opus.


Se GPT-5.6 fosse paragonabile a Mythos in termini di prestazioni, o addirittura leggermente inferiore, ma a un prezzo molto più conveniente, potrebbe comunque riuscire a aumentare l'utilizzo effettivo in una città.


Attualmente, OpenAI non ha ancora rilasciato alcuna dichiarazione ufficiale; il vero duello dovrà aspettare il momento in cui la versione finale di GPT-5.6 e Fable saranno state testate direttamente a confronto.


Probabilmente sarà deciso questo mese, tenetevi in attesa!


Riferimenti:

[1]https://x.com/mark_k/status/2063922897341567488?s=20

[2]https://x.com/AiBattle_/status/2064078302394917157?s=20

[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20

[4]https://x.com/synthwavedd/status/2063245096951160865?s=20

[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20

[6]https://x.com/koltregaskes/status/2062806155139912164?s=20


L'autore proviene da "Quantum Bit" con lo pseudonimo di "Ascolta la Pioggia".

È stato utile?

Supporto tecnicoAssistenza online
侧栏
Torna in alto
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR