• OpenAI-Wissenschaftler Noam Brown: Die wahre Obergrenze der KI kann sich niemand leisten

    Mit dem zunehmenden Einsatz großer Sprachmodelle in anspruchsvollen Aufgaben wie komplexer Inferenz, automatisierter Forschung und Netzwerksicherheit stehen herkömmliche Methoden zur Bewertung von Modellen vor neuen Herausforderungen.Seit langem werden Modelle veröffentlicht, zusammen mit Ergebnistabellen, die aus verschiedenen Benchmarks wie Mathematik, Programmierung, wissenschaftlichen Fragen und Antworten sowie Netzwerksicherheit bestehen, und diese werden mit den Ergebnissen der vorherigen Generationen verglichen.

    OpenAI-Wissenschaftler Noam Brown: Die wahre Obergrenze der KI kann sich niemand leisten
  • Während der KI-Forschung wird Claude dumm, Anthropic wird von der Forschungsgemeinschaft belagert

    Claude Fable 5 ist heute das zentrale Thema im Bereich KI und dieses „mythologische“ Modell zeichnet sich durch hervorragende Leistung aus, was es zu einer großen Attraktion macht.Andrej Karpathy bezeichnet dies als „sehr aufregend“ und als einen „sprunghaften Fortschritt, der einer großen Versionserweiterung würdig ist“ – auf dem gleichen Niveau wie die Verbesserungen, die im November letzten Jahres mit Claude 4.5 eingeführt wurden. Im SWE-bench Pro-Programmierbenchmark erzielte Fable 5 eine Punktzahl von 80,3%, was 11 Prozentpunkte mehr sind als Opus 4.8. Mit einem Ruby-Codebase, der aus 50 Millionen Zeilen besteht, gelang die vollständige Migration des Codebasses innerhalb eines Tages. Würde dieselbe Aufgabe einem menschlichen Team übertragen, würde dies mehr als zwei Monate in Anspruch nehmen.

    Während der KI-Forschung wird Claude dumm, Anthropic wird von der Forschungsgemeinschaft belagert
  • GPT-5.6 Die ersten Tests sind da! Scharfschütze Mythos

    Vor kurzem hat Anthropic den „großen Killer“ veröffentlicht, der zwei Monate lang versteckt war –Claude Fable 5undMythos 5Es ist, als würde man eine Bombe werfen.Jetzt drücken wir direkt Druck auf OpenAI aus.

    GPT-5.6 Die ersten Tests sind da! Scharfschütze Mythos
  • Claude Fable 5 Tipps Leaked, 6 Stunden Test Wirkung, wirklich verrückt?

    Fable 5 ist gerade veröffentlicht worden, und schon wurden die Systemhinweise durchsickern:Nachdem man diese Hinweise gelesen hat, gibt es einige wichtige Punkte zu beachten:Erstens hat Fable der Artifact-Klasse eine API für die dauerhafte Speicherung hinzugefügt (window.storage). Ein Artifact ist ein einzigartiger Inhalt, der durch den Claude-Code erzeugt wird, wie z. B. HTML-Seiten oder React-Komponenten. Früher konnten Artefakt-Daten nicht gespeichert werden und dienten eher als einmalige Demos. Jetzt können die Daten über Sitzungen hinweg gespeichert werden, was die Nutzung von „gedächtnisvermögenssichen“ Tools ermöglicht, wie z. B. Ranglisten, Pinnwänden oder Tagebüchern.

    Claude Fable 5 Tipps Leaked, 6 Stunden Test Wirkung, wirklich verrückt?
  • Auf dem sich erwärmenden Markt für Sprachkünstliche Intelligenz ist ein Start-up namens Hojo aufgetaucht.

    Voice AI ist eine weitere Story-Linie außerhalb des universellen großen Modells. Während alle auf das große GM-Modell schauten, begannen einige bemerkenswerte neue Modelle auf der relativ ruhigen Strecke von Voice AI zu erscheinen. Die Tastatur verliert ihre „Hominanz". In den vergangenen zwei Jahren hat OpenAI die Realtime-API eingeführt, Google hat Gemini Live eingeführt und fast alle großen Modellunternehmen in China haben begonnen, Voice AI zu entwickeln. Immer mehr Menschen glauben, dass die Sprache, wenn der Agent wirklich in den Workflow kommt, ein natürlicher kontextueller Eingang wird als die Tastatur. Wenn der Agent wirklich in den Workflow eintreten will, muss er zuerst lernen, diese Geräusche zu verstehen. Die erste Funktion, die dahinter steht, ist ASR (Automatic Speech Recognition). Um das ASR-Level zu messen, wird in der Branche am häufigsten das Open ASR Leaderboard von Hugging Face zitiert, wobei die Kernmetrik die Wörterfehlerrate (WER) ist, je niedriger die Zahl ist, desto genauer die Erkennung ist.

Keine weiteren Einträge