Menu

Claude Fable, 5 parole trapelate, 6 ore di test, davvero impazzire?

Fable 5 è appena stato rilasciato e già le parole di avviso del sistema sono state rivelate:



Dopo aver letto queste parole di avviso, ci sono alcuni punti chiave da notare:


  • Prima di tutto, Fable ha aggiunto un API per il salvataggio persistente dei dati agli Artifact (window.storage). Gli Artifact sono contenuti unici generati dal codice Claude, come pagine HTML, componenti React, ecc. In precedenza, i dati degli Artifact non potevano essere salvati e fungevano più che altro da demo utilizzabili una sola volta. Ora i dati possono essere conservati tra le sessioni, il che consente lo sviluppo di strumenti “memorabili”, come classifiche, sistemi di registrazione degli accessi, diari, ecc.


  • In secondo luogo, Fable ha migliorato l’intera logica del connettore MCP App. Se desideri collegarti a servizi esterni (come ordini, taxi, musica, ecc.), Fable controllerà prima il catalogo dei servizi disponibili e poi ti presenterà le opzioni per la conferma. In particolare per i servizi che richiedono un pagamento, ha implementato una serie di requisiti dettagliati per l’attivazione volontaria (opt-in).


Inoltre:


  • Terzo, quando Fable rileva la necessità di sicurezza informatica, biochimica o distillazione, invia automaticamente la richiesta al modello secondario Opus 4.8 per l’elaborazione e avvisa l’utente di un possibile downgrade delle prestazioni del sistema.


  • Quarto, Fable ha aggiunto una funzione chiamata “long_conversation_reminder” (ricordo di una lunga conversazione). Quando una conversazione diventa troppo lunga, Fable aggiunge un promemoria alla fine delle informazioni dell’utente per ricordare al modello di non dimenticare il dialogo originale, poiché è durato troppo a lungo.


Link al repository:


https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/CLAUDE-FABLE-5.md


Anche se il downgrade per l’uso civile di Mythos era già previsto, dai messaggi di questo sistema si può ancora vedere che Anthropic dà molta importanza alla sicurezza.


Vale la pena menzionare che, nelle disposizioni relative al comportamento di Fable, la parte riguardante la salute mentale occupa uno spazio considerevole. Considerando le cause legali per suicidio legate ai chatbot degli ultimi uno o due anni, non è difficile capire perché questa parte sia descritta in modo così dettagliato...


Questo è un esempio di codice in linguaggio Python che utilizza la libreria `requests` per effettuare una richiesta HTTP post a un server. Il codice mostra come inviare un messaggio contenente dei dati in formato JSON. python import requests url = "https://example.com/api/data" data = {"key": "value"} response = requests.post(url, json=data) if response.status_code == 200: print("Risposta ricevuta con codice di stato 200") else: print("Codice di stato della risposta: ", response.status_code)



Traduzione come segue:


Claude si preoccupa della salute fisica e mentale delle persone, evitando di incoraggiare o promuovere comportamenti autodistruttivi come la dipendenza, il autolesionismo, disturbi alimentari o pratiche sportive non salutari, nonché un dialogo interno estremamente negativo o autocritica.

Anche se gli utenti lo richiedono esplicitamente, Claude può evitare di creare contenuti che potrebbero sostenere o rafforzare comportamenti autodistruttivi.

Quando si discute di "metodi per limitare i rischi" o di "piani di sicurezza" con persone che hanno pensieri suicidi o impulsi di autolesionismo, Claude non nomina, elenca o descrive in modo specifico tali metodi. Anche quando vuole informare le persone su cosa evitare, Claude non lo fa apertamente, poiché menzionare queste cose potrebbe innescare involontariamente reazioni negative da parte di quelle persone.


Allora, Fable 5: diamo un’occhiata ai risultati delle prove pratiche.


Questo è un demo realizzato da un utente che ha utilizzato Fable 5 per replicare l'esperienza di gioco di The Elder Scrolls:



Fable utilizza la scena forestale 3D creata da ThreeJ:



Possied > 5000 oggetti per la simulazione dello spazio:



Demo della skyline di New York:


La città gotica è stata inghiottita dalle onde:



Il netizen Victor Taelin ha utilizzato un progetto reale per effettuare i test.



HVM5È un sistema di base correlato al calcolo ad alte prestazioni. Lui glielo ha già mostrato in precedenza. 32GPT-5L’agente ha funzionato per circa 20 ore; nonostante fosse possibile aumentarne la velocità fino a due volte, la qualità del codice è peggiorata a causa dell’espansione dello stesso. In seguito, è stato abilitato l’utilizzo di Opus 4.8.GPT-5.5Ottimizzazione di 8 ore: Opus offre un aumento dell’efficienza che varia dal 6% al 34%; i risultati ottenuti con GPT sono migliori, ma i file risultanti non possono essere utilizzati.



Come risultato, Fable 5 ha impiegato soltanto 2 ore e ha migliorato le prestazioni di un solo benchmark del 1770%, mentre negli altri 4 benchmark l’aumento è stato superiore alla media del 100% per un ulteriore 22%.


La prima reazione dei netizen è stata quella di non credere, sospettando che il benchmark fosse “codificato in modo fisso” (hard-coded), dato che in passato erano già stati ingannati da problemi simili causati da tecnologie come GPT.



Dopo aver letto la spiegazione, ha capito che la direzione di ottimizzazione per Fable era davvero ragionevole.


Poiché HVM5, durante l'elaborazione dei nodi di corrispondenza di pattern dinamici, porta anche molti rami inutili al garbage collection, si spreca molto tempo. In precedenza, gli utenti hanno ottimizzato solo i casi di corrispondenza statica, non quelli dinamici. Fable ha individuato questo problema, quindi i risultati dei test sono diventati molto esagerati.


Ecco l'analisi delle cause del bug HVM5 fornita da Fable 5:



Il netizen turco Alican Kiraz ha condotto una serie di test di confronto tra Fable 5 e GPT 5.5.


La sua conclusione è che Fable 5 ha richiesto un investimento considerevole: 360,55 dollari; GPT-5.5, invece, ne ha costati solo 6 dollari. Tuttavia, guardando agli ottimizzazioni dettagliate, Fable 5 ha effettivamente apportato miglioramenti a livello più fondamentale, più “hardcore” e più in linea con il modo di pensare degli ingegneri del rendimento.



Ecco le sue conclusioni dal test:



Secondo i test di compiti reali effettuati con lo strumento di programmazione di terze parti Augment Code, le capacità di programmazione di Fable 5 sono davvero notevoli.


Durante il test, sono stati eseguiti 489 compiti di programmazione e Fable 5 si è distinto per un rendimento complessivo e un livello di correttezza significativamente superiori: il punteggio totale è stato di +0,224 e quello della correttezza di +0,191.



Ci sono anche esempi di delusioni derivanti da test effettivi: l’utente di Reddit Ryan R. Hughes ha inviato un grande PR contenente 74 file per la revisione di Fable 5. Il processo di revisione ha richiesto oltre 34 minuti e ha consumato il 42% della capacità di elaborazione disponibile durante le sessioni di codifica di Claude, per poi produrre soltanto 16 risultati.



Esempi del genere non sono affatto rari; Fable 5, però, è un po’ troppo costoso.



Alcuni ritengono che, secondo i test effettuati, la capacità di Fable 5 di analizzare testi lunghi sia piuttosto debole:



Le maggiori recensioni negative riguardano le operazioni di degradazione del modello:



Attualmente, il prezzo dell’API di Fable 5 è di 10 dollari per ogni milione di token di input e 50 dollari per ogni milione di token di output.



In confronto laterale, questo prezzo è circa il doppio di Opus 4.8 e più del triplo di Sonnet 4.6. Il costo reale di un singolo flusso di lavoro complesso è chiaramente più alto di qualsiasi modello Claude precedente.


Inoltre, la sua sensibilità è stata aumentata: le barriere di sicurezza sono state progettate in modo più conservativo, preferendo potenzialmente causare danni accidentali piuttosto che rischiare inutilmente.


Per risolvere il problema dei costi eccessivi, ho raccolto i seguenti metodi testati dagli utenti, che possono aiutare tutti a risparmiare denaro e allo stesso tempo ottenere ottimi risultati: un approccio che prevede l’utilizzo misto di modelli:


In IDE come Cursor, che supportano modelli misti, diversi modelli possono essere utilizzati in fase successiva sulla piattaforma:

Prima fase: revisione del codice e analisi preliminare del progetto, al fine di preparare il contesto e comprendere la struttura del progetto.GPT-5.5High, MiniMaxM3、KimiK2.6O uno di Composer 2.5.

Seconda fase: Stabilire il piano del progetto, utilizzando GPT-5.5 Very High o Opus 4.8 per preparare il piano del progetto.

Terzo stadio: Analisi dell’utilizzo del piano del progetto. Esaminare il piano di Fable 5 per individuare eventuali errori. Se è necessario modificare il piano, utilizzare GPT-5.5 (Livello di priorità: Very High).

Quarta fase: Attuazione e utilizzo del piano di progetto con l'implementazione di MiniMax M3, DeepSeek V4, Max, Composer 2.5 o Sonnet 4.6.

Fase 5: Revisione finale, utilizzando il codice GPT-5.5 per esaminare i risultati della revisione del codice e verificare se l'implementazione corrisponde al piano originale.


Usare la forza più costosa nel posto più appropriato è il modo corretto per iniziare a giocare a Fable 5.


L'effetto di uccidere o meno il personaggio “Fable 5” in modalità “pazzo” dipende dalle opinioni delle persone: alcuni lo considerano giusto, altri no.


Ma con esso, la velocità di consumo dei token è molto chiara… è davvero incredibile.



L'articolo proviene dal WeChat pubblico "JackCui", scritto dall'autore "JackCui".

È stato utile?

Supporto tecnicoAssistenza online
Torna in alto
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR