OpenAI科學家Noam Brown:AI的真正上限,可能根本沒人測得起
隨著大語言模型逐漸進入複雜的推理、自動化研究和網絡安全等困難任務,傳統的模型評價方法正面臨著新的挑戰。
長期以來,模型發佈往往伴隨著由數學、編程、科學問答、網絡安全、知識推理等多種基準測試組成的結果表,並與上一代模型進行水平比較。

OpenAI 研究員 Noam Brown 最近,該文章指出,當模型在回答問題時使用更多的推理步驟、調用更多的工具或執行更長時間的搜索和測試時,單一分數越來越難以準確反映模型的實際能力。

Brown 核心觀點如下:大模型的性能不僅取決於模型本身,還取決於模型在推理階段獲得了多少計算資源。在未來評估模型時,我們不能只問「模型得了多少分?」,還應該回答另一個問題:模型消耗了多少 token、在多少成本和運行時間的前提下,取得這一成績?
他建議行業應該從頭開始「單點成績」轉向「推理計算量曲線的性能」,並將推理預算視為人工智能安全政策中的模型能力評估和基本變量。
傳統成績表可能低估新模型的能力差距
Brown 以 GPT-5.5 以發佈後的市場反應為例,說明瞭傳統模型排名的局限性。
按照他的描述,GPT-5.5 在發佈初期,外界首先注意到的是一組不是特別顯眼的基準測試結果。以及 GPT-5.4 相比之下,新模型的分數有所提高,但從傳統的分數表來看,提高幅度似乎有限。因此,一些用戶對新版本持觀望甚至質疑態度。
但在模型開放後的幾個小時內,一些用戶發現,隨著開發者和研究人員開始測試更複雜的任務,GPT-5.5 在長鏈推理、持續執行和處理複雜問題方面表現出更明顯的代際差異。Brown 認為,這種「實際經驗明顯增強,但名單分數變化有限」這種現象反映了傳統評價沒有完全呈現模型的能力。
問題是,不同模型的評估結果可能不是基於相同的推理預算。
在傳統的評價框架中,研究人員經常為每個模型選擇一套測試配置,以盡可能提高結果,然後將最終分數放在同一表中。這似乎是公平的,但它可能會掩蓋一個關鍵變量:一些模型可以得到更多的推理 token、更多的調用次數或更長的運行時間後,繼續顯著提高性能;其他模型可能更早達到性能上限。
Brown 顯示的網絡安全評估案例表明,如果所謂的所謂模型只比較每個模型,「計算最大測試時的量」條件下的最終結果,GPT-5.5 相較 GPT-5.4 優勢可能不突出。但如果是的話 token 將數量、推理成本或延遲控制在同一水平,然後觀察不同模型的性能,GPT-5.5 能力提升會更加明顯。

換句話說,模型之間的差距不僅體現在最終分數上,也體現在使用額外推理計算量的效率上。
為甚麼不能簡單?「跑到性能不再提高為止」
直觀的解決方案是繼續為每個模型增加推理資源,直到其性能進入平台期,然後比較其最高能力。
Brown 認為這種想法在實踐中可能不可行。原因是對於新一代模型來說,性能平台期可能比預期晚得多,甚至在實際可承受的預算範圍內難以觀察。
他引用了 Andrej Karpathy 以發起的自動化研究實驗為例。在相關實驗中,模型繼續進行大量實驗後,性能仍保持改進趨勢。即使實驗數百次,改進曲線也不完全溫和。

Brown 同時,英國人工智能安全研究所也提到了英國人工智能安全研究所(AI Security Institute)網絡安全評估結果。在此評估中,包括 Mythos 和 GPT-5.5 一些模型,包括在內,累計使用超過 1 億 token 之後,任務表現繼續提高。

這種現象意味著模型可以利用越來越長的運行時間和越來越大的推理預算,在複雜的任務中不斷探索、嘗試和糾正策略。更強大的模型不僅有更高的起點,而且可能更擅長將額外的計算資源轉化為有效的能力。
Brown 據推測,隨著模型能力的提高,其有效運行的任務週期也會延長。在過去,人們可能會在相對有限的預算下觀察到,模型性能趨於穩定;在未來,性能上限可能會被推遠。在某些任務中,所謂「平台期」它甚至可能不再是一個容易測量的狀態。
從單一分數轉向「性能-成本曲線」
面對這一變化,Brown 建議模型發佈機構應改變基準測試的呈現方式。
與其只公佈一個最終分數,不如在橫軸上標注推理計算量,在縱軸上顯示任務性能,並繪制完整的性能變化曲線。橫軸可用 token 數量、推理成本或實際運行時間等指標。
這種方法可以回答傳統成績表中難以解釋的問題。例如,在相同的預算下,哪個模型表現得更好?當預算增加十倍時,哪個模型改進得更快?模型接近能力上限嗎?不同模型的成本效益如何變化?
類似的方法已經開始用於一些基準測試。Brown 提到,ARC-AGI 評估試圖衡量模型分數與運行成本之間的關係,而不僅僅是發佈單一分數。

另一個可行的方案是為評估設置明確的方案 token、成本或時間限制,並提前通知模型預算信息。這種方式類似於人類參加標準化考試:無論是美國大學入學考試 SAT,或者國際數學奧林匹克比賽,參賽者需要在固定時間內完成任務。模型能力也可以在統一的約束下進行比較。
不過,Brown 同時,指出不同的指標是有限的。
token 由於不同模型使用的分詞器、生成速度和單位,數量可能無法直接跨模型進行比較 token 成本可能會有所不同。成本受硬件利用率、批量處理和工程實現的影響。由於運行時間不是一個完美的指標,因此運行時間也不是一個完美的指標「多智能體合作」或 best-of-N 等待技術可以並行生成多個候選答案,不一定會顯著增加用戶感受到的等待時間,同時顯著增加總計算量。
儘管如此,他認為上述任何指標都比脫離推理預算的單一分數更有信息量。
推理預算問題正在擴展到人工智能安全評估
Brown 討論不限於模型列表。他認為,推理預算也會直接影響前沿模型的安全管理。
在發佈前沿人工智能模型之前,R&D機構通常會評估網絡攻擊、生物風險、化學風險等潛在濫用能力。如果模型達到一定的風險閾值,R&D機構可能需要推遲發佈,或者在部署前增加訪問限制、監控機制等緩解措施。
問題是,如果模型能力隨著推理計算量的增加而提高,安全評估應該使用多少推理預算?
事實上,普通用戶可能只會為一項任務投資幾美元或幾十美元。然而,一個資金充足的組織、專業團隊或國家行為人可能願意為單一目標投資遠高於普通用戶的資源。如果評估機構只在較低的預算下測試模型,則可能會低估其在高資源條件下的風險能力。
Brown 以 Gemini 3 Deep Think 以發佈後的爭議為例。他指出,Deep Think 基準測試結果明顯高於以前的模型,但在發佈時沒有同步提供完整的系統卡,以滿足該版本的風險能力。這種做法引起了一些人工智能安全研究人員的批評。


不過,在 Brown 爭議背後似乎存在著更深層次的問題:人工智能企業和安全機構尚未形成一套用於評估不同推理預算下模型能力的穩定方法。
他推測,Deep Think 它可能不是一個完全獨立訓練的新模型,而是一個基於其他現有模型的推理腳手架系統。該系統可以通過多次調用模型、並行生成候選結果、自動檢查答案和迭代修正來提高複雜的任務性能。
假如這個判斷成立了,那麼 Deep Think 理論上,不僅平台本身可以實現所展示的部分能力。只要外部開發人員願意投入足夠高的推理成本,他們也可以結合多個模型調用來構建類似的工作流。Deep Think 作用,更多的是將原本需要專業開發能力的複雜推理流程封裝成普通用戶也可以方便調用的產品形式。
因此,Brown 人們認為,真正值得注意的問題不是產品是否單獨發佈了系統卡,而是研發機構是否在不同的推理預算和腳手架策略下充分測試了基本模型最初發佈時可能達到的能力水平。
高預算評估難以全面實施,但可以嘗試外推
理論上,一個資源充足的行為體可能會在單一任務上投入更多 1000 一萬美元的推理成本。然而,安全評估通常涉及數千甚至數百萬次測試。如果每次操作都使用極高的預算,評估成本將很快失去可行性。
Brown 提出可以先在相對可控的推理預算範圍內進行測試,然後根據模型能力隨計算量變化的趨勢推動更高預算條件下的性能。同時,評估機構應明確標記預測範圍和不確定性,而不是將計算結果視為確定結論。

該方法類似於通過局部數據估計更大規模系統的變化趨勢。它不能取代實際測試,但它可以幫助研發機構和監管機構理解當模型被賦予更多的時間、工具和計算資源時,風險邊界可能會發生甚麼變化。
不過,Brown 還承認,長週期任務仍可能帶來短期實驗難以解決的問題。
例如,如果研究人員想判斷一個獨立的智能主體在持續運行一年後是否會有目標偏差、戰略欺騙或其他不匹配行為,那麼最可靠的方法可能仍然是讓智能主體實際運行足夠長的時間。僅僅根據幾個小時或幾天的實驗結果,它可能無法捕捉到長期行為中的關鍵變化。
這將產生一個新的現實矛盾:人工智能模型的開發和發佈週期可能只有幾個月,而智能身體可以持續運行的任務週期可能越來越長。在未來,研發機構可能會面臨一個特殊情況——下一代模型在覆蓋其最大運行週期之前就已經接近發佈。
三個建議:使推理預算成為模型評估的基本變量
針對能力評估和安全治理中的上述問題,Brown 提出三項具體建議。
首先,人工智能研發機構在發佈新模型時,應在不同的推理預算條件下公佈基準測試性能。理想情況下,企業應提供 token 數量、成本或運行時間是橫軸的性能曲線。至少,企業需要解釋在實現單點結果時實際使用了多少推理資源。
第二,基準測試排名應記錄推理資源的消耗,或為參考模型設置統一 token、成本或時間限制。目前,一些評估已被納入相關變量,但該行業尚未形成標準實踐。
第三,人工智能企業的準備框架(Preparedness Framework)以及負責任的擴大政策(Responsible Scaling Policy,RSP)推理階段的計算資源應明確考慮。當機構判斷模型是否跨越一定的安全閾值時,不僅要檢查單一配置下的性能,還要評估多個推理預算水平,對更高預算條件下的風險能力進行不確定性預測。
該行業已經意識到了這個問題,但評估系統還沒有完全跟上
在推理階段增加計算資源可以提高模型性能,這不是一個新的發現。
自 OpenAI 在 2024 年 9 月發佈 o1 自該系列推理模型以來,該行業普遍認為,該模型在回答問題時投入了更多的推理步驟,可以在數學、代碼和複雜的分析任務中取得更好的效果。圍繞「計算測試時的擴展情況」或「計算推理時的擴展」研究也逐漸成為大模型發展的重要方向。
但 Brown 據認為,在這一趨勢出現近兩年後,許多尖端模型的發佈仍然主要依靠單一的基準分數進行傳播和比較。一些安全機構也可以在腳手架系統使用幾十倍甚至數百倍的推理預算後重新審視模型能力的邊界。
隨著模型越來越擅長使用長期運行、多輪試錯和大規模推理資源,傳統列表的解釋可能會繼續下降。在低預算問答、高預算深度研究、多智能協作和自動化工具呼叫等不同條件下,同一基本模型可能表現出完全不同的能力水平。
Brown 判斷是,在未來測量人工智能能力時,推理預算不應再被視為測試過程中的輔助信息,而應成為評估報告中的核心參數,如模型規模、培訓數據和上下文窗口。
從更廣泛的角度來看,這也意味著人工智能產業正在逐漸告別「用一個數字定義一個模型」階段。對於能力評估、產品比較和安全管理來說,真正重要的問題可能不僅僅是模型能做甚麼,而是當它獲得足夠的時間、資金和計算資源時能做甚麼。
參考連接:https://x.com/polynoamial/status/2064210146558136827
作者來自「機器之心」 「機器之心編輯部」。
有用嗎?