GPT-5.6最初のテストが来ました!ミス·ショット·ミステス
さっき、Anthropicは2ヶ月間隠していた大きな発表をしました——Claude Fable 5そしてMythos 5まるで爆弾を投げ落としたかのようだ。
現在、直接OpenAIに圧力をかけましょう。

同時に、GPT-5.6も漏洩しました。
OpenAIは先週から内部コードのテストを開始しています。keplerそしてkindle2つの新しいチェックポイントがあります。kindle-alphaの公開候補として選ばれました。

GPT-5.6の内部テストバージョンが海外の開発者やリーク情報のコミュニティで急速に広まり、評価されています。コードや候補バージョン、実際の使用感などがすでに公開されています。

IPOを争うにせよ、フラッグシップモデルが衝突するにせよ、両社は「私もあなたの申請書を提出します」「あなたが新しいモデルを発表すれば、私も新しいモデルを発表します」という状況です。
純粋には、激しい競争が繰り広げられています。
しかし問題は、GPT-5.6が本当にMythosを打ち負かすことができるのでしょうか??

GPT-5.6が明らかになりました。
これまでのところ、OpenAIはGPT-5.6に対抗していますが、公式な発表はまだありませんし、正式にリリースされていません。
しかし、多くの海外のネットユーザーは、「内部チェックポイント」プローブのテストがすでに完了していることを公開していません。
いわゆるチェックポイントとは、モデルがトレーニング中のある時点で保存したパラメータのスナップショットのことです。
OpenAI内部には多くのチェックポイントがあり、それらを横断的に比較した後、「十分に良い」と判断されたバージョンをリリース候補版(RC)として選び出します。
先週から、OpenAIの内部ではkindleとkeplerというコードネームの2つの新しいチェックポイントがテストされています。その中でkindle-alpha候補版が公開されることになりました。

流出した情報によると、GPT-5.6で最も繰り返し言及されているアップグレードはフロントエンド/UIの生成です。。
ネットユーザーのPankaj Kumarによると、KindleはAlphaのフロントエンド生成能力を大幅に向上させたそうです。より強力なインターフェースを直接出力できるようになり、複雑なヒントや追加のスキルが不要になりました。。

また、その視覚能力も非常に優れており、画像理解や画像参照のタスクにおいて良好なパフォーマンスを発揮しています。推論、エンコーディング、UI生成の分野でも顕著な改善が見られました。
これはネットユーザーのChrisがKindleの性能を測定した結果で、Medium設定を使用しています:

これは別のネットユーザーが以前にNon-Inference版のJouleで測定した結果です:

前者の方がはるかに洗練されていることがわかります。
しかし、ネットユーザーのLeoは同じプロンプト、Kepler、Kindleを使用してXHigh設定で測定しました。
Keplerと比較して、Kindleはまだ性能が低下していることがわかりました。

ええと…この効果は本当に評価しにくいですね。
彼はさらに、OpenAIがさらに改良を続ける可能性が高いと判断しています。最終的にKindleを候補版として使用しなくなる可能性も排除できません。。
最新のニュースとしては、KindleがArenaから外され、新しいモデルが登場しました。Levi。
ネットユーザーの中には、LeviがGPT-5.6の内部バージョンのコードネームである可能性もあると推測しており、GPT-5.5のフロントエンド機能と比較しています:

これにより、Leviのフロントエンドもかなり優れていることがわかります。スタイルはシンプルで洗練されており、高級感があります。細部の処理も非常に丁寧です。
しかし、あるネットユーザーが発見しました。LeviはMetaから来た可能性が高く、GPT-5.6ではないかもしれません。

では、GPT-5.6は本当にMythosに勝てるのでしょうか?
ネットユーザーのmark_kは、GPT-5.6が「複数のagenticによってMythossのコーディングベンチマークを破った」と主張しています。

しかし、現在よりも説得力があるのは、先ほど示されたネットユーザーLeoの実際のテスト結果です。彼はGPT-5.6の状況はあまり良くないと考えています:
keplerと比べると、kindleは後退しています。現在の形では、Mythosに簡単に打ち負かされるでしょう。。
6月には、御三家が「スピードとパッション」を演じます。
6月になると夏が来て、大規模なAIモデルの分野も活気づき始めました。
海外のトップ3のAIモデルがほぼ同時にリリースされました:Fable 5、Gemini 3.5 Pro、GPT-5.6。これにより、「生死をかけた競争」が繰り広げられました。
そして、これらのモデルはすべて同じ機能を持っています:推論、エージェント、コーディング、フロントエンド生成です。
興味深いことに、6月にこれら3社が力を入れたにもかかわらず、現時点で実際に成果を発表したのはA社だけです。。
Gemini 3.5 Proは5月19日に開催されたGoogle I/Oカンファレンスで発表され、200万トークンのコンテキスト処理とDeep Think推論に特化しています。
しかし、まだ正式にリリースされていません。公式には6月に正式に利用可能になる予定です。
GPT-5.6。このニュースは今月後半に発表されるとのことです。
これはOpenAIの状況にも新たな緊張感をもたらしています。競合他社はすでにスコアを公開しており、内部ではどのRCバージョンを提出すべきかで議論が続いている可能性があります。
しかし、スコアテストだけでなく、価格設定も重要な要素です。
Fable 5.Mythos 5の統一価格はToken10ドルで、Token50ドルです。
これは現在のOpusの約2倍です。
もしGPT-5.6能力はMythosと同等か、やや劣るものの、価格ははるかに安いため、実際の利用度において都市を取り戻す可能性はまだあります。
現時点ではOpenAIからの公式な発表はありませんが、本格的な決闘はもう少し待たなければなりません。GPT-5.6正式版とFableの正面からの比較評価が行われるその瞬間です。——
この月には結果が明らかになる可能性が高いので、ぜひご期待ください〜
参考リンク:
[1]https://x.com/mark_k/status/2063922897341567488?s=20
[2]https://x.com/AiBattle_/status/2064078302394917157?s=20
[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20
[4]https://x.com/synthwavedd/status/2063245096951160865?s=20
[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20
[6]https://x.com/koltregaskes/status/2062806155139912164?s=20
著者は「量子位」の「听雨」さんです。
役に立ちましたか?