• Open AI科学者Noam Brown:AIの本当の限界は誰も測定できないかもしれない

    大言語モデルが複雑な推論、自動化研究、ネットワークセキュリティなどの困難なタスクに徐々に適用されるにつれて、従来のモデル評価方法は新たな課題に直面しています。長い間、モデルのリリースには、数学、プログラミング、科学の質問応答、ネットワークセキュリティ、知識推論など、さまざまなベンチマークテストの結果が含まれるレポートが伴い、それらが前世代のモデルと比較されてきました。

    Open AI科学者Noam Brown:AIの本当の限界は誰も測定できないかもしれない
  • AI研究でクロードは密かに愚かになり、Anthropicは研究コミュニティに包囲される

    Claude Fable 5は今日、AI分野における中心的な話題であり、この「神話的」なモデルのパフォーマンスは非常に優れており、数多くの注目を集めています。Andrej Karpathy氏は、昨年11 月にClaude 4.5で導入されたものと同じレベルの“大規模なアップグレードに値する飛躍的な進歩”であると述べた。SWE-bench Proプログラミングベンチマークでは、Fable 5は80.3%のスコアを獲得し、Opus 4.8を11ポイント上回った。コードベースに5000 万行のコードを持つRubyは、同じ作業量を人間チームに任せると2 ヶ月以上かかるライブラリ全体の移行を1日で完了しました。

    AI研究でクロードは密かに愚かになり、Anthropicは研究コミュニティに包囲される
  • GPT-5.6最初のテストが来ました!ミス·ショット·ミステス

    さっき、Anthropicは2ヶ月間隠していた大きな発表をしました——Claude Fable 5そしてMythos 5まるで爆弾を投げ落としたかのようだ。現在、直接OpenAIに圧力をかけましょう。

    GPT-5.6最初のテストが来ました!ミス·ショット·ミステス

これ以上ありません