OpenAI科學家Noam Brown:AI的真正上限,可能根本沒人測得起
隨著大語言模型逐漸進入複雜的推理、自動化研究和網絡安全等困難任務,傳統的模型評價方法正面臨著新的挑戰。長期以來,模型發佈往往伴隨著由數學、編程、科學問答、網絡安全、知識推理等多種基準測試組成的結果表,並與上一代模型進行水平比較。...
隨著大語言模型逐漸進入複雜的推理、自動化研究和網絡安全等困難任務,傳統的模型評價方法正面臨著新的挑戰。長期以來,模型發佈往往伴隨著由數學、編程、科學問答、網絡安全、知識推理等多種基準測試組成的結果表,並與上一代模型進行水平比較。...
Claude Fable 5 是今天 AI 該領域的核心熱點,這個「神話級」模型性能非常出色,吸引了無數的關注。Andrej Karpathy 稱其「非常令人興奮」,是「配得上大版本升級的躍遷式進步」,與去年 11 月 Claude 4.5 所帶來的提升屬於同一水平。SWE-bench Pro 編程基準,Fable 5 拿到了 80.3% 得分,超越 Opus 4.8 整整 11 一個百分點。擁有一個 5000 萬行代碼的 Ruby 在代碼庫中,它在一天內完成了全庫遷移,如果將同樣的工作量交給人類團隊,需要兩個多月的時間。...
剛才,Anthropic發佈了藏了兩個月的大殺手——Claude Fable 5和Mythos 5,就像扔下一枚炸彈。現在直接給OpenAI施加壓力。...
Fable 5 剛上線,系統提示詞就洩露了:看完這個提示詞,有幾點比較關鍵:第一,Fable 給 Artifact 增加了持久存儲 API(window.storage)。Artifact 就是 Claude 代碼生成的獨特內容,如 HTML 頁面、React 組件等。以前 Artifact 數據無法保存,更像是一次性 demo。現在數據可以跨會話保存,可以支持「有記憶」的小工具,如排行榜、打卡器、日記等。...
Voice AI,是通用大模型之外的另一條故事線。 當所有人都在盯著通用大模型時,Voice AI 這條相對安靜的賽道里,也開始出現一些值得注意的新模型。 鍵盤正在失去它的「統治地位」。 過去兩年,OpenAI 推出了 Realtime API,Google 做出了 Gemini Live,國內的大模型公司也幾乎都開始佈局 Voice AI。越來越多的人開始相信,當 Agent 真正進入工作流之後,語音會成為比鍵盤更自然的上下文入口。 如果 Agent 想真正進入工作流,它首先要學會聽懂這些聲音。而這背後對應的第一層能力,就是 ASR(自動語音識別)。 衡量 ASR 水平,業內最常引用的是 Hugging Face 的 Open ASR Leaderboard,核心指標是詞錯誤率(WER),數字越低,識別越准。...
沒有更多了