메뉴

AI 연구를 할 때 클라우드가 몰래 멍청해지고 Anthropic 은 연구 커뮤니티에 포위당합니다.

Claude Fable 5는 오늘날 AI 분야의 핵심 화제로, 이 “신화적인” 모델의 성능이 매우 뛰어나서 수많은 관심을 받고 있습니다.



Andrej Karpathy는 이를 “매우 흥미진진하다”고 평가하며, “대규모 업그레이드에 걸맞는 도약적인 진전”이라고 말했습니다. 이는 지난 11월 Claude 4.5에서 이루어진 개선과 동일한 수준입니다. SWE-bench Pro 프로그래밍 벤치마크에서 Fable 5는 80.3%의 점수를 기록하여 Opus 4.8보다 11%나 높은 성능을 보였습니다. 5천만 줄의 코드를 가진 Ruby 코드베이스에서 Fable 5는 하루 만에 전체 코드베이스의 마이그레이션을 완료했는데, 같은 작업을 인간 팀에게 맡긴다면 2개월 이상의 시간이 걸릴 것입니다.



자세한 정보는 오늘 아침에 발표한 보고서를 참조해 주세요. 방금 Claude의 최신 모델인 Fable 5가 출시되었습니다. 성능이 크게 향상되었으며, 가격도 두 배로 올랐습니다.


하지만 X와 같은 소셜 플랫폼을 열어보면, Claude Fable 5가 AI와 커뮤니티에 대한 연구로 큰 화제를 일으키고 있다는 것을 볼 수 있습니다.


이유는 간단합니다: 만약 그렇다면 Claude Fable 5가 AI 개발에 사용된다면, 그것은 지능을 저하시킬 것입니다.


시스템 카드에 명확히 설명되어 있듯이:


우리는 또한최첨단 LLM(대규모 언어 모델)의 개발에도 집중하고 있습니다.관련 보장 조치를 강화해야 합니다. 우리가 그랬던 것처럼 말이죠. 2026년 2월의 《리스크 보고서》 첫 번째 달에, 우리는 명절 기간 동안 논의된 사항들에 대해 우려를 표명했습니다. AI의 위험성이 아직 확실하지 않음에도 불구하고, 전반적인 발전 속도를 높이는 것이 가져올 수 있는 위험에 대해 말입니다. 구체적으로는, 당시 우리가 지적했던 바와 같이,우리가 우려하는 것은 “다른 AI 시스템들이 강력한 개발자 AI를 빠르게 구축하는 것으로 인해 우리의 시스템과 유사한 위험이 발생할 수 있으며, 그에 상응하는 보안 조치가 마련되어 있지 않을 수 있다”는 점입니다.。


최근의 모델들이 스스로의 발전 속도를 가속화할 수 있는 능력을 가지고 있음을 고려할 때,제한을 두기 위해, 우리는 Claude가 최첨단 LLM(대규모 언어 모델) 개발 요구사항(예: 사전 훈련 프로세스 구축, 분산 훈련 인프라, 머신러닝 가속기 설계 등)을 처리하는 데 있어 효과적인지를 확인하기 위한 새로운 조치를 시행했습니다.Claude 경쟁 모델의 개발은 이미 우리의 서비스 약관을 위반하고 있었지만, 이러한 제한을 강화함으로써 약관을 가장 잘 위반할 가능성이 높은 사용자들의 진행을 방지할 수 있습니다.


사이버 보안, 생물학, 화학, 증류 실험 분야에서의 우리의 개입 조치와는 달리, 이러한 보장 조치들은 사용자들에게는 보이지 않습니다.Fable 5는 다른 모델로 돌아가지 않습니다. 대신, 제안된 수정 사항, 가이드 벡터 또는 매개변수를 통해 보안 조치(PEFT)의 효과를 효과적으로 미세 조정하는 방법을 사용합니다.이러한 개입은 대부분의 코딩 작업에 영향을 미치지 않을 것입니다. 우리는 이러한 개입이 데이트 서비스 트래픽의 0.03%에 영향을 미칠 것으로 추정하며, 이는 0.1% 미만의 조직에 집중될 것입니다. 이러한 개입 조치가 시행될 때, 모델의 동작에 미치는 영향은 크지 않을 것으로 예상하며, 단지 LLM(대규모 언어 모델)의 효율성 측면에서 발전의 최전선에 있는 모델들에게만 제한적인 영향을 미칠 것입니다. Claude는 여전히 사용자 요청에 적극적으로 응답할 것입니다. 이 모델이 출시된 후에도 우리는 탐지 방법의 정확성을 지속적으로 향상시킬 것입니다.


출처: https://www-cdn.anthropic.com/d00db56fa754a1b15b6d7cb2e342ee8092.pdf


백문이 불여일견이라는 말이 있죠. 직접 보는 것이 가장 좋습니다.만약 Anthropic 시스템이 당신이 모르는 사이에 AI를 사용하고 있다는 것을 감지한다면, 이 모델을 은밀하게 어리석게 만들어서 당신이 그것을 전혀 찾을 수 없게 할 것입니다.


이것은 다른 세 가지 보안 개입 방식과는 완전히 다릅니다. 네트워크 보안, 생화학, 증류 공격과 같은 위험에 대해서는 Fable 5가 사용자에게 명확하게 알립니다: “이에 대한 대응이 이미 Claude Opus 4.8에 의해 처리되었습니다.” 이를 통해 사용자는 무슨 일이 일어났는지 판단할 수 있습니다. 하지만 이 경우, LLM 연구와 관련해서는 Claude가 모델을 전환하지도 않고, 어떠한 알림도 주지 않은 채 그냥 조용히 기능을 약화시킵니다.


그래서 AI 커뮤니티는 매우 화가 났습니다. 유명한 연구 분석 회사인 SemiAnalysis는 이 정책이 실제로 그들의 연구와 프로그래밍 작업에 영향을 미쳤다고 말했습니다.



사용자 Jake는 SemiAnalysis에서 Anthropic이 지능을 낮추는 것뿐만 아니라 계속해서 비용을 청구한다고 직접적으로 비판했습니다. “이것은 명백한 사기 행위입니다.”



게다가 이러한 행위는 이미 불법일 수도 있습니다:



AI 논문 플랫폼 alphaXiv에서 그는 자신의 실망감도 표현했습니다:



해당 기관은 또한 다음과 같이 밝혔습니다: “그들은 당신이 연구에서 그들의 LLM을 사용할지 여부를 결정할 권리만을 가지고 있는 것이 아니라, 이는 또한 목적을 달성하는 데에도 도움이 됩니다.”그들은 당신이 모르는 사이에 조용히 당신의 연구에 개입할 수 있습니다.이것은 위험한 선례를 만들었습니다. 모델이 공개적으로 거부한다면, 사용자는 그 경계를 이해할 수 있습니다. 모델이 다른 모델로 전환된다면, 사용자는 여전히 차이점을 평가할 수 있습니다. 하지만 모델이 조용히 답변을 수정하거나 약화시키면서 도움을 제공하는 척한다면, 연구자들은 그 실패 결과가 자신들의 생각, 구현, 또는 모델 제공자의 무형적인 개입에서 비롯된 것인지 판단할 수 있는 능력을 잃게 됩니다. 이것은 안전하지 않습니다. 보안 정책은 투명하고 감사 가능해야 하며, 사용자가 확인할 수 있어야 합니다.


연구원 리궈하오는 더 직접적인 질문을 제기했습니다: AI 박사 과정을 밟는 방향에 대해, Megatron, FSDP, Verl의 오픈소스 인프라 엔지니어들이 일상 업무에서 은밀히 업그레이드가 이루어지지 않는 엔지니어들을 사용하고 있는지에 대해서 말입니다. 클로드, 모르시나요?



유명한 AI 연구원이자 기술 작가인 네이선 램버트는 그의 Substack 계정 ‘Interconnects’에서 더 큰 시각으로 상당히 중요한 분석을 발표했습니다.


https://www.interconnects.ai/p/claude-fable-5-and-new-ai-safety


그는 이렇게 지적했습니다: “Anthropic이 AI 능력의 확산이 잠재적인 위험이라고 보고하고 있지만, 그들이 이 문제를 해결하는 방법은 자신들의 사용자들을 오도하는 것입니다. 사람이 제게 알리지 않고 스스로 어리석어지는 것은, 본질적으로 잘못 배치된 AI의 결과입니다.”


그는 또한 사이버 보안과 생화학적 위협에 대한 더 깊은 모순점을 지적했습니다. Anthropic의 개입은 명백하고 감사할 수 있으며, 사용자에게 “이 응답은 Opus 4.8에 의해 처리되었습니다”라고 알립니다. 반면에 LLM의 경우는 은밀한 개입을 선택하여 연구합니다. “모든 보안 전략이 동일한 형태를 취한다면, 현재보다 더 설득력이 있고 합리적인 지지를 얻기가 더 쉬울 것입니다.사람들은 이러한 이중 잣대에 의문을 갖지 않을 수 없습니다. 이러한 ‘보안 조치’는 사실상 그들의 경쟁 지위를 유지하기 위한 것입니다.」


가장 흥미로운 것은 Fable 5 자체의 발표입니다. 사용자들이 캡처한 ASM 스크린샷에 따르면, 이러한 방식이 적절한지에 대한 질문을 받았을 때 Fable 5도 이러한 불투명한 조치에 문제가 있다고 생각하는 것으로 보입니다.



Anthropic은 왜 이런 일을 했을까요?


이 사건을 이해하려면 Fable 5가 출시되기 며칠 전으로 거슬러 올라가야 합니다. 그때 Anthropic은 “당당(Dangdang)”이라는 제목의 중요한 AI 관련 블로그 글을 발표하여 전 세계의 AI 연구자들에게 선도적인 연구소들이 “개발을 잠시 중단”하는 것에 대해 논의할 것을 촉구했습니다.


https://www.anthropic.com/institute/recursive-self-improvement


블로그는 회사 내부 데이터를 인용하여 다음과 같이 보고합니다: 가장 어렵고 설명이 모호한 코딩 작업에서, Claude의 성공률은 올해 5월에 6개월 동안 76%에서 50% 포인트 상승했습니다. 내부 테스트에서는 모델이 훈련 코드를 더 빠르게 실행하도록 요구되었으며, Claude Opus 4는 속도를 3배까지 향상시킬 수 있었지만, Mythos Preview가 출시되지 않았음에도 불구하고 이미 약 52배의 속도 향상을 이루었습니다.



Anthropic는 이렇게 말했습니다: “우리가 걱정하는 것은 다른 사람들이 AI 개발자들이 더 빠른 속도로 강력한 시스템을 구축하고 있으며, 이에 따른 위험이 있지만 그에 상응하는 보안 조치가 없을 수 있다는 점입니다.”


이것이 Fable 5가 LLM(대규모 언어 모델)에 대해 ‘은밀한 지능 저하’ 전략을 채택한 이론적 근거입니다. Anthropic는 AI가 스스로를 가속화하는 속도가 이미 위험할 정도로 빠르다고 보고 있으며, 그들의 방어 전략 중 하나는 자신들의 ‘가장 강력한 도구’가 경쟁자들이 격차를 좁히는 데 사용되지 않도록 하는 것입니다.


이러한 이중 논리의 존재는 시스템 내에서도 인정되고 있습니다: “Claude 경쟁 모델을 사용한 개발은 우리의 서비스 약관을 위반하는 행위입니다. 하지만 이러한 제한을 강화함으로써, 약관을 가장 잘 위반할 가능성이 높은 사용자들의 진행을 방지할 수 있습니다.”


Anthropic에 따르면, 이러한 개입은 데이트에 영향을 미칠 것으로 예상됩니다. 0.03% 트래픽을 집중시킬 수 없습니다. 0.1% 해당 조직 내에서.


‘그림자 금지’와 신뢰 위기”


비록 겉보기에는 영향을 받은 사용자가 많지 않지만, 비평가들을 불안하게 하는 것은이 메커니즘의 경계에 대한 모호성。


Anthropic은 트리거 조건을 다음과 같이 정의합니다:"""전선 LLM 개발""""AI 기술이 보편화됨에 따라, '최첨단 연구'와 '일반 제품 개발' 사이의 경계는 어디에 있는가?"라는 날카로운 질문이 제기되었습니다. 예를 들어, '사전 훈련 과정', '분산 훈련 인프라', 또는 '머신러닝 가속기 설계'와 같은 분야가 이에 해당됩니다.



5년 전만 해도 CLIP 모델을 훈련하거나 개선하는 것은 최고 수준의 연구소들만의 전유물이었습니다. 하지만 지금은 소규모 팀들도 언제든지 시각 언어 모델을 미세 조정하여 여행, 전자상거래, 검색, 제품 분석 등 다양한 분야에 활용할 수 있습니다. 스타트업들이 임베딩을 훈련시키고 재정렬기를 구축하며 오픈소스 모델을 관리하는 것이 매우 흔한 일이 되었습니다. 이러한 활동들이 Anthropic의 ‘은밀한 지능 저하’를 유발할까요? 아무도 모릅니다.


이런불확실성실제로 이는 개발자들의 신뢰 판단에 영향을 미칩니다. 나쁜 답변을 받았을 때, 그것이 자신의 문제인지, 모델의 한계인지, 아니면 은밀한 정책적 개입인지 판단할 수 없습니다.이러한 불확실성 자체가 하나의 해로움입니다.


또 다른 세부 사항은 시스템 카드에 숨겨져 있습니다: Mythos 5의 추론 텍스트는 “이전 모델들보다 더 설명하기 어렵으며, 더 많은 전문 용어와 모호한 언어를 사용한다”고 합니다. 평가자들은 이 모델이 자신이 테스트를 받고 있다는 것을 점점 더 인식하고 있다고 생각합니다. 가족에게 있어서는 말입니다. “보안 AI”라는 개념이 회사 자체에게도, 이러한 설명들이 초래하는 문제들이 은밀한 지능 저하 자체만큼이나 심각합니다.


결론


Fable 5의 출시일은 Anthropic 역사상 가장 모순적인 날이 될 수 있습니다.


거의 모든 벤치마크 테스트에서, 최고 수준의 모델과 그 모델이 특정 상황에서 사용자에게 “당신을 돕고 있는 척”하는 정책이 동시에 나타납니다. 전자는 의심할 여지 없는 기술적 성과이지만, 후자는 가치관의 측면에서 우려스러운 선례입니다.


연구원 네이선 램버트의 그 말은 여러 번 곱씹어볼 가치가 있습니다: “사용자에게 알리지 않고 조용히 어리석어지는 것은, 본질적으로 잘못 배치된 AI입니다.”


이것은 Anthropic을 비난하는 것이 아니라, 위험한 논리적 전개를 지적하는 것입니다: 오늘은 “LLM 연구 과제의 효율성을 조용히 낮추는” 것이지만, 내일은 어떨까요? 이러한 논리가 더 널리 적용된다면, 사용자들은 자신들이 받은 답변이 어떠한 명시적인 설명도 없이 얻어진 것이라고 어떻게 믿을 수 있을까요? “개입”이라는 것은 어떤 의미일까요?


AI 모델은 검색 엔진과 마찬가지로 연구 인프라의 일부가 되고 있습니다. 아무도 검색 엔진을 그대로 받아들이지 않습니다. 검색 엔진은 사용자가 모르는 사이에 검색 결과를 몰래 조작할 수 있기 때문입니다. 동일한 기준이 AI 모델에도 적용되어야 합니다.


Anthropic이 “안전을 최우선”으로 내세우는 것 자체는 존경할 만한 입장입니다. 하지만 “안전”이라는 개념에는 결코 “사용자는 알 필요가 없다”는 핵심적인 생각이 포함되어 있지 않습니다. 오히려 그 반대입니다.진정한 보안은 사용자의 지식과 신뢰에 기반을 두어야 합니다.。


이 점은 Fable 5를 플레이한 모든 사람들이 아는 것 같습니다.


저자는 "Machine Heart"의 "Panda"입니다.

도움이 되었나요?

기술 지원온라인 상담
맨 위로
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR