做AI研究時Claude會偷偷變笨,Anthropic被研究界圍攻
Claude Fable 5 是今天 AI 該領域的核心熱點,這個「神話級」模型性能非常出色,吸引了無數的關注。

Andrej Karpathy 稱其「非常令人興奮」,是「配得上大版本升級的躍遷式進步」,與去年 11 月 Claude 4.5 所帶來的提升屬於同一水平。SWE-bench Pro 編程基準,Fable 5 拿到了 80.3% 得分,超越 Opus 4.8 整整 11 一個百分點。擁有一個 5000 萬行代碼的 Ruby 在代碼庫中,它在一天內完成了全庫遷移,如果將同樣的工作量交給人類團隊,需要兩個多月的時間。

有關詳細信息,請參閱我們今天早上的報告,剛才,Claude 最強模型 Fable 5 發佈:性能爆炸,價格翻倍。
然而,打開 X 等待社交平台,我們可以看到 Claude Fable 5 已在 AI 對社區的研究引起了轟動。
原因很簡單:如果是的話 Claude Fable 5 用於研發 AI,它會降智。
正如系統卡中明確說明的那樣:
我們還針對前沿 LLM 的開發增加相關保障措施。就像我們在一樣。 2026 年 2 《風險報告》第一個月 6.1 我們擔心節日期間討論的事情 AI 儘管這些風險的嚴重程度仍不確定,但加快整體發展步伐帶來的風險。具體來說,正如我們當時所指出的,我們擔心的是「加速其他 AI 建立強大的開發者 AI 這些系統可能會帶來類似於我們系統的風險,但可能沒有相應的安全措施」。
鑒於近期模型具有加速自身發展的能力,為了限制,我們實施了新的乾預措施 Claude 處理涉及前沿 LLM 開發要求的有效性(如構建預訓練流程、分布式訓練基礎設施或機器學習加速器設計等。)。使用 Claude 競爭模型的開發已經違反了我們的服務條款,但通過加強這一限制,可以避免加快最有可能違反條款的行為者的進程。
與我們在網絡安全、生物學、化學和蒸餾試驗方面的乾預措施不同,這些保證措施對用戶來說是看不見的。Fable 5 它不會回到其他模型。相反,通過提示修改、引導向量或參數來有效地微調安全措施(PEFT)限制其有效性的方法。這些乾預不會影響大多數編碼工作。我們估計它們會影響約會 0.03%的流量集中在不到 在0.1%的組織中。當這些乾預措施生效時,我們預計它們對模型的行為影響不大,只會限制它們處於發展的前沿 LLM 有效性方面。Claude 仍將積極響應用戶要求。本模型發佈後,我們將繼續提高檢測方法的準確性。

來自:https://www-cdn.anthropic.com/d00db56fa754a1b15b6d7cb2e342ee8092.pdf
翻譯成白話:如果 Anthropic 系統檢測到你在做 AI 在你不知情的情況下,研究會悄悄地讓這個模型變得愚蠢,你根本找不到它。
這與其他三種安全乾預完全不同。對於網絡安全、生物化學、蒸餾攻擊等風險,Fable 5 會明確告知用戶:「響應已由此產生 Claude Opus 4.8 處理。」可以相應判斷用戶知道發生了甚麼。但是對於它。 LLM 研究這一類,Claude 既不切換模型,也不給任何提示,只是默默無聲地變弱。
於是,AI 社區很生氣。知名研究分析公司 SemiAnalysis 該政策實際上影響了他們的研究和編程工作。

用戶 Jake 則在 SemiAnalysis 直斥 Anthropic 不但降智,還繼續收費,「這是一種明目張膽的欺詐行為」。

而且這種行為可能已經違法:

AI 論文平台 alphaXiv 他還表達了自己的失望:

該機構還進一步表示:「它們不僅有權決定你在研究中使用它們 LLM 這也使得目的他們可以在你不知情的情況下默默乾預你的研究。這確立了一個危險的先例。如果模型公開拒絕,用戶可以理解邊界。如果模型返回到另一個模型,用戶仍然可以評估差異。然而,如果模型悄悄地修改或削弱答案,同時假裝提供幫助,研究人員將失去判斷失敗結果是否來自他們自己的想法、實現或模型提供商進行無形乾預的能力。這不安全。安全政策應該是透明的、可審計的,並且可以向用戶看到。」
研究員 Guohao Li 它提出了一個更直接的問題:攻讀 AI 博士生的方向,貢獻 Megatron、FSDP、Verl 開源基礎設施工程師是否在日常工作中使用悄悄降級的工程師? Claude,你不知道嗎?

著名 AI 研究人員,技術作家 Nathan Lambert 在其 Substack「Interconnects」從更宏觀的角度來看,發佈了一個相當重要的分析。

https://www.interconnects.ai/p/claude-fable-5-and-new-ai-safety
他指出:「Anthropic 正在記錄 AI 能力傳播是一種隱患,但他們解決這個問題的方法是誤導他們自己的用戶。一個人在不通知我的情況下自動變傻了 AI 模型本質上是一種錯位 AI。」
他還指出了對網絡安全和生物化學威脅的更深層次矛盾,Anthropic 乾預是顯性的、可審計的,通知用戶「這條響應由 Opus 4.8 處理」;但對於 LLM 但選擇了隱性乾預進行研究。「如果所有的安全策略都採用相同的形式,它將比現在更有說服力,更容易獲得理性的支持。人們不得不懷疑這個雙重標準:這個『安全措施』更多的是為了維護他們的競爭地位。」
最耐人尋味的是 Fable 5 自己的聲明。用戶 ASM 截圖顯示,當被問及這種做法是否合適時,Fable 5 我似乎也認為這種不透明的操作有問題。

Anthropic 為甚麼要這樣做?
要理解這件事,你需要先回去 Fable 5 發佈前幾天,Anthropic 發表了一篇題為《當當》的文章 AI 重磅博文開始自我建設,呼籲全世界 AI 討論頭部實驗室「暫停開發」的可能性。

https://www.anthropic.com/institute/recursive-self-improvement
博文援引公司內部數據:在最困難、描述最不清楚的編碼任務中,Claude 今年 5 月成功率達到 6個月內76%上升 50 一個百分點。在內部測試中,要求模型使訓練代碼運行得更快,Claude Opus 4 可以提高速度 3 倍,但沒有發佈 Mythos Preview 已能提高約 52 倍。

Anthropic 直言:「我們擔心的是讓其他人擔心 AI 開發者以更快的速度構建了一個強大的系統,具有類似的風險,但可能沒有相應的安全措施。」
這是 Fable 5 針對 LLM 設置隱形降智的理論依據:Anthropic 認為,AI 自我加速的速度已經快到危險,他們的護城河之一就是不讓自己「最強工具」幫助競爭對手縮短差距。
這種雙重邏輯的存在也在系統卡中得到承認:「使用 Claude 競爭模型的開發已經違反了我們的服務條款,但通過加強這一限制,可以避免加快最有可能違反條款的行為者的進程。」
Anthropic 據估計,這種乾預將影響約會 0.03% 不能集中流量 0.1% 的組織中。
「影子禁言」與信任危機
雖然表面上受影響的用戶並不多,但讓批評者不安的是該機制邊界的模糊性。
Anthropic 將觸發條件定義為「前沿 LLM 開發」,並舉例為「預訓練過程,分布式訓練基礎設施或機器學習加速器設計」。然而,研究人員和開發人員提出了一個尖銳的問題: AI 技術普及,「前沿研究」與「開發普通產品」它們之間的邊界在哪裡?

五年前,訓練或改造 CLIP 該模型是頂級實驗室的專利。如今,小型團隊可以隨時微調視覺語言模型,用於旅遊、電子商務、搜索和分析產品。初創企業培訓 embedding 建立重排序器和托管開源模型是很常見的..這些工作會觸發 Anthropic 隱形降智?沒人知道。
這種不確定性它實際上影響了開發者的信任判斷。當你得到一個糟糕的答案時,你無法判斷它是你自己的問題,模型的限制,還是一個安靜的政策乾預。這種不可知性本身就是一種傷害。
另一個細節隱藏在系統卡中:Mythos 5 的推理文本「比以前的模型更難解釋,包括更多的行話和晦澀的語言」,評估師認為它越來越意識到它正在被測試。對於一個家庭來說。「安全 AI」對於自居公司來說,這些描述帶來的問題並不比隱形降智本身少。
結語
Fable 5 發佈日可能是 Anthropic 歷史上最矛盾的一天。
在幾乎所有的基準測試中,一個頂級模型和一個讓它在某些時候對用戶「假裝在幫你」同時出現的政策。前者是毫無疑問的技術成就,後者是價值觀層面令人不安的先例。
研究員 Nathan Lambert 那句話值得反復咀嚼:「悄悄地變得愚蠢,但不通知用戶 AI,本質上是錯位的 AI。」
這不是指控 Anthropic 相反,它指出了一種危險的邏輯滑坡:今天是「悄悄降低 LLM 研究任務的有效性」,明天呢?如果這套邏輯應用得更廣泛,為甚麼用戶相信他們得到的答案沒有得到任何未經聲明的答案?「乾預」?
AI 模型正成為研究基礎設施的一部分,就像搜索引擎一樣。沒有人會接受搜索引擎,它會在你不知道的時候悄悄篡改搜索結果。同樣的標準應該適用於 AI 模型。
Anthropic 打出了「安全第一」旗幟本身就是一個值得尊敬的立場。但是「安全」從來沒有核心「用戶不需要知道」。恰恰相反,真正的安全必須基於用戶的知識和信任。
這一點,似乎是連的 Fable 5 大家都知道。
作者來自「機器之心」 "Panda"。
有用嗎?