菜單

GPT-5.6首批實測來了!精准狙擊Mythos

剛才,Anthropic發佈了藏了兩個月的大殺手——Claude Fable 5和Mythos 5,就像扔下一枚炸彈。


現在直接給OpenAI施加壓力。


GPT-5.6首批實測來了!精准狙擊Mythos 第1張


同一時間,GPT-5.6也洩露了。


OpenAI從上周開始測試內部代碼kepler和kindle兩個新的檢查點。kindle-alpha曝光已被選為發佈候選人。


GPT-5.6首批實測來了!精准狙擊Mythos 第2張


GPT-5.6的內部測試版本開始在海外開發者和洩漏圈中瘋狂測量。代碼、候選版本、跑步體感都被翻了出來。


GPT-5.6首批實測來了!精准狙擊Mythos 第3張


無論是爭奪IPO,還是旗艦模型撞車,兩家公司「我也遞表你的表」「你發新模型,我也發新模型。」。


純潔就是打得不可開交。


但問題是,GPT-5.6真的能打過Mythos嗎??


GPT-5.6首批實測來了!精准狙擊Mythos 第4張


GPT-5.6浮出水面


到目前為止,OpenAI已經對抗了GPT-5.6仍然是零官方公告,尚未正式發佈。


然而,許多海外網民還沒有公開「內部檢查點」探針測試已經完成。


所謂檢查點(checkpoint),是模型在訓練過程中某個時間點存儲的參數快照。


OpenAI內部會有很多份,橫向比較,然後從裡面挑一個「足夠好,可以拿去發」這個版本叫發佈候選版(RC)。


從上周開始,OpenAI內部正在測試兩個新的檢查點,代號是kindle和kepler。其中kindle-alpha候選版被選中發佈。


GPT-5.6首批實測來了!精准狙擊Mythos 第5張


從流出的體感來看,GPT-5.6這次最反復提到的升級是生成前端/UI。


網友Pankaj Kumar的說法是,kindle-大大提高了alpha的前端生成能力,可以直接輸出更強的界面輸出,而不需要複雜的提示詞或額外的技能。


GPT-5.6首批實測來了!精准狙擊Mythos 第6張


此外,它的視覺能力它也很好,在圖像理解和圖像引用任務方面表現良好,在推理、編碼和UI生成方面有了顯著的改進。


這是網友Chris測量kindle的效果,使用medium檔位:


GPT-5.6首批實測來了!精准狙擊Mythos 第7張


這是另一位網友之前在非推理版Joule上測量的效果:


GPT-5.6首批實測來了!精准狙擊Mythos 第8張


可見前者精緻多了。


但是網友Leo拿了同樣的prompt、kepler和kindle分別在xhigh檔位測量。


與kepler相比,發現kindle還在退步。


GPT-5.6首批實測來了!精准狙擊Mythos 第9張


嗯..這種效果真的很難評價。


他甚至判斷OpenAI很可能會繼續打磨,不排除最終棄用kindle作為候選版。


最新消息是,kindle已經被移出Arena,出現了一個新模型Levi。


有網友猜測Levi也可能是GPT-5.6內部版本的代號,並將其與GPT-5.5的前端能力進行了比較:


GPT-5.6首批實測來了!精准狙擊Mythos 第10張


由此可見,Levi的前端也相當不錯,風格清新簡約,富有高級感,細節處理也很到位。


但有網友發現,Levi可能來自Meta,而不是GPT-5.6。


GPT-5.6首批實測來了!精准狙擊Mythos 第11張


那麼,GPT-5.6到底能打過Mythos嗎?


網友mark_k聲稱,GPT-5.6「多個agentic 擊敗Mythoss的coding基準」。


GPT-5.6首批實測來了!精准狙擊Mythos 第12張


但目前更有說服力的是前面展示的網友Leo的實測。他認為GPT-5.6的情況並不樂觀:


與kepler相比,kindle是退步。以其目前的形式,很容易被Mythos擊敗。


六月,御三家上演「速度與激情」


六月,夏天來了,大模型圈也熱了起來。


海外AI御三家模型的發佈時間都撞在了一起:Fable 5、Gemini 3.5 Pro、GPT-5.6,上演了一出「生死時速」。


而且玩的是同一批能力-推理、智能體、編碼、前端生成。


有趣的是,雖然三家公司在6月份都把節點壓在了上面,但是到目前為止,真正交卷子的只有A社一家。


Gemini 3.5 Pro出現在5月19日的谷歌I/O大會上,專注於200萬token上下文和Deep Think推理。


但是還沒有正式上線,官方定於6月正式可用。


GPT-5.6,消息傳出是本月晚些時候發佈。


這也給OpenAI的情況增添了一層張力:對手已經把分數貼出來了,內部可能還在糾結應該交哪個RC版本。


但除了跑分,定價也是一個重要因素。


Fable 5.Mythos 5統一定價為Token10美元,Token50美元。


約為現有Opus的兩倍。


如果GPT-5.6在能力上與Mythos持平甚至略有損失,但價格要便宜得多,那麼它仍然有可能在實際利用率上拉回一個城市~


目前OpenAI還沒有官方公告,真正的決鬥要等GPT-5.6正式版和Fable正面跑分的那一刻。——


這個月大概率見分曉,敬請期待~


參考鏈接:

[1]https://x.com/mark_k/status/2063922897341567488?s=20

[2]https://x.com/AiBattle_/status/2064078302394917157?s=20

[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20

[4]https://x.com/synthwavedd/status/2063245096951160865?s=20

[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20

[6]https://x.com/koltregaskes/status/2062806155139912164?s=20


作者來自「量子位」 "聽雨"。

有用嗎?

技術支持在線客服
側欄
返回頂部
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR