• Noam Brown, scienziato di OpenAI: il vero limite dell 'IA, nessuno può permettersi di misurare

    Con l'avanzamento dei grandi modelli linguistici nell'esecuzione di compiti complessi come il ragionamento, la ricerca automatizzata e la sicurezza informatica, i metodi tradizionali di valutazione dei modelli si trovano ad affrontare nuove sfide.Da tempo, il rilascio di un modello è accompagnato da una tabella di risultati che include vari test di benchmark, che spaziano dalla matematica, alla programmazione, alle domande scientifiche, alla sicurezza informatica e al ragionamento conoscitivo, e questi risultati vengono confrontati con quelli del modello precedente.

    Noam Brown, scienziato di OpenAI: il vero limite dell 'IA, nessuno può permettersi di misurare
  • Claude diventa stupido mentre lavora su AI, Anthropic viene assediato dalla comunità di ricerca

    Claude Fable 5 è il punto focale dell’attualità nel campo dell’AI: questo modello “mitico” ha prestazioni eccezionali e ha attirato un’enorme attenzione.Andrej Karpathy lo ha definito “molto entusiasmante” e un “progresso significativo che merita un aggiornamento di major versione”, paragonabile agli miglioramenti apportati da Claude 4.5 lo scorso novembre. Nel benchmark di programmazione SWE-bench Pro, Fable 5 ha ottenuto il 80,3% dei punti, superando Opus 4.8 di ben 11 punti percentuali. Con un codice in Ruby che conta 50 milioni di righe, Fable 5 è riuscito a completare la migrazione dell’intero repository in un solo giorno; se lo stesso compito fosse stato affidato a un team umano, avrebbe richiesto più di due mesi.

    Claude diventa stupido mentre lavora su AI, Anthropic viene assediato dalla comunità di ricerca
  • GPT-5.6 è arrivato il primo test! Sniper di precisione Mythos

    Poco fa, Anthropic ha rilasciato il suo “grande assassino”, che era stato nascosto per due mesi…Claude Fable 5EMythos 5È come lanciare una bomba.Ora esercitiamo direttamente pressione su OpenAI.

    GPT-5.6 è arrivato il primo test! Sniper di precisione Mythos
  • Claude Fable, 5 parole trapelate, 6 ore di test, davvero impazzire?

    Fable 5 è appena stato rilasciato e già le parole di avviso del sistema sono state rivelate:Dopo aver letto queste parole di avviso, ci sono alcuni punti chiave da notare:Prima di tutto, Fable ha aggiunto un API per il salvataggio persistente dei dati agli Artifact (window.storage). Gli Artifact sono contenuti unici generati dal codice Claude, come pagine HTML, componenti React, ecc. In precedenza, i dati degli Artifact non potevano essere salvati e fungevano più che altro da demo utilizzabili una sola volta. Ora i dati possono essere conservati tra le sessioni, il che consente lo sviluppo di strumenti “memorabili”, come classifiche, sistemi di registrazione degli accessi, diari, ecc.

    Claude Fable, 5 parole trapelate, 6 ore di test, davvero impazzire?
  • Il settore dell’AI vocale, in rapida crescita, ha visto l’emergere di una nuova startup chiamata Hojo.

    La voce AI rappresenta un’altra linea di sviluppo, diversa da quella dei grandi modelli generali. Mentre tutti sono concentrati sui grandi modelli generali, anche nel campo relativamente più tranquillo della voce AI stanno emergendo modelli nuovi che meritano attenzione. La tastiera sta perdendo il suo “dominio”. Negli ultimi due anni, OpenAI ha lanciato il Realtime API, Google ha creato Gemini Live, e quasi tutte le aziende cinesi che lavorano su grandi modelli hanno iniziato a investire nel settore della voce AI. Sempre più persone credono che, una volta che gli agenti digitali entreranno davvero nei flussi di lavoro, la voce diventerà un’interfaccia più naturale rispetto alla tastiera. Se un agente digitale vuole davvero integrarsi nei flussi di lavoro, deve prima imparare a comprendere queste voci. La prima capacità necessaria per questo è l’ASR (riconoscimento vocale automatico). Per misurare il livello di un sistema ASR, nell’industria si utilizza comunemente la classifica Open ASR di Hugging Face, la cui metrica principale è il tasso di errore di parola (WER): più basso è il valore, più precisa è la riconoscimento.

Non ci sono altri contenuti