OpenAI 과학자 Noam Brown : AI 의 진정한 한계는 아무도 측정 할 수 없습니다.
대형 언어 모델들이 점차 복잡한 추론, 자동화 연구, 네트워크 보안과 같은 어려운 과제에 도전하면서, 전통적인 모델 평가 방법들은 새로운 도전에 직면하고 있습니다.
오랫동안 모델의 출시는 수학, 프로그래밍, 과학적 질문응답, 네트워크 보안, 지식 추론 등 다양한 벤치마크 테스트 결과로 구성된 보고서와 함께 이루어졌으며, 이전 세대의 모델들과 수준을 비교해 왔습니다.

OpenAI 연구원 노암 브라운(Noam Brown)은 최근 한 논문에서, 모델이 질문에 답변할 때 더 많은 추론 단계를 거치거나, 더 많은 도구를 사용하거나, 더 긴 시간 동안 검색 및 테스트를 수행할 경우, 단일 점수만으로는 모델의 실제 능력을 정확하게 반영하기가 점점 더 어려워진다고 지적했습니다.

브라운의 핵심 주장은 다음과 같습니다:대형 모델의 성능은 모델 자체뿐만 아니라, 추론 단계에서 얼마나 많은 컴퓨팅 자원을 확보했는지에도 달려 있다고 합니다.미래에 모델을 평가할 때, 우리는 “모델이 몇 점을 받았는가?”라는 질문만을 해서는 안 됩니다. 또 다른 질문도 해야 합니다: 모델이 얼마나 많은 토큰을 소비했는지, 어떤 비용과 실행 시간을 기반으로 그러한 성과를 얻었는지도 알아야 합니다.
그는 업계가 “단일 점수”에서 “추론 계산량 곡선의 성능”으로 평가 방식을 바꿔야 한다고 제안하며, 추론 예산을 인공지능 보안 정책에서 모델 능력을 평가하는 기본 변수로 간주해야 한다고 말합니다.
전통적인 성과 평가 방식은 새로운 모델들의 능력 차이를 과소평가할 수 있습니다.
Brown은 GPT-5.5를 사용하여 출시 후의 시장 반응을 예로 들어, 전통적인 모델 순위의 한계를 설명했습니다.
그의 설명에 따르면, GPT-5.5의 초기 발표 당시에 외부에서 가장 먼저 주목받은 것은 그다지 눈에 띄지 않는 벤치마크 결과였습니다. 또한 GPT-5.4와 비교했을 때 새 모델의 점수가 향상되었지만, 전통적인 점수표를 기준으로 볼 때 그 향상 폭은 제한적인 것으로 보였습니다. 그 결과 일부 사용자들은 새 버전에 대해 보수적인 태도를 취하거나 의문을 제기하고 있습니다.
하지만 모델이 공개된 지 몇 시간 만에, 일부 사용자들은 개발자와 연구자들이 더 복잡한 작업을 테스트하기 시작하면서 GPT-5.5가 장기 추론, 지속적인 실행, 그리고 복잡한 문제 처리에서 더 뚜렷한 세대 간 차이를 보인다는 것을 발견했습니다. 브라운(Brown)은 이러한 현상, 즉「실제 경험이 명확히 향상되었지만 목록 점수의 변화는 제한적이었다」는 것이 전통적인 평가 방법이 모델의 능력을 완전히 반영하지 못하고 있음을 보여준다고 생각합니다.
문제는 다른 모델들의 평가 결과가 동일한 추론 예산을 기반으로 하지 않을 수 있다는 것입니다.
전통적인 평가 프레임워크에서 연구자들은 각 모델에 대해 일련의 테스트 설정을 선택하여 결과를 최대한 향상시키고, 최종 점수를 동일한 표에 표시하는 경향이 있습니다. 이는 공정해 보일 수 있지만, 중요한 변수를 간과할 수 있습니다. 일부 모델은 더 많은 추론 토큰을 받거나, 더 많은 호출 횟수를 경험하거나, 더 긴 실행 시간을 가진 후에도 성능을 계속해서 크게 향상시킬 수 있습니다. 반면에 다른 모델들은 성능의 한계에 더 빨리 도달할 수 있습니다.
Brown이 제시한 네트워크 보안 평가 사례에 따르면, 소위 모델들을 단순히 비교할 때 “최대 테스트 시의 계산량” 조건 하에서의 최종 결과만을 고려한다면, GPT-5.5가 GPT-5.4보다 우위가 두드러지지 않을 수 있습니다. 하지만 계산량, 추론 비용, 또는 지연 시간을 동일한 수준으로 유지한 상태에서 다양한 모델의 성능을 관찰한다면, GPT-5.5의 성능 향상이 더욱 명확해질 것입니다.

다시 말해, 모델들 간의 차이는 최종 점수뿐만 아니라 추가적인 추론 계산량을 사용하는 효율성에서도 나타납니다.
왜 간단하게 할 수 없을까요? “성능이 더 이상 향상되지 않을 때까지 계속 실행하라”는 것처럼요.
직관적인 해결책은 각 모델에 추론 리소스를 계속 추가하여 그 성능이 안정적인 수준에 도달할 때까지 만들어내고, 그 후에 그들의 최고 성능을 비교하는 것입니다.
Brown은 이러한 아이디어가 실제로는 실행 가능하지 않을 수 있다고 생각합니다. 그 이유는 새로운 세대의 모델들에게 있어서 성능 플랫폼 기간이 예상보다 훨씬 더 늦게 도래할 수 있으며, 심지어 실제로 감당할 수 있는 예산 범위 내에서도 이를 관찰하기 어려울 수 있기 때문입니다.
그는 Andrej Karpathy가 시작한 자동화 연구 실험을 예로 들었습니다. 해당 실험에서 모델은 수많은 실험을 거친 후에도 성능이 계속 향상되는 경향을 보였습니다. 실험이 수백 번 반복되더라도, 성능 향상의 곡선은 완전히 완만하지 않았습니다.

Brown 또한, 영국 인공지능 보안 연구소(AI Security Institute)의 네트워크 보안 평가 결과에 대해서도 언급했습니다. 이 평가에서는 Mythos와 GPT-5.5를 포함한 일부 모델들이 1억 개 이상의 토큰을 사용한 후에도 작업 성능이 계속 향상되는 것으로 나타났습니다.

이러한 현상은 모델들이 점점 더 긴 실행 시간과 더 많은 추론 자원을 활용하여 복잡한 작업에서 지속적으로 탐색하고, 전략을 시도하며, 수정할 수 있음을 의미합니다. 더 강력한 모델들은 더 높은 출발점을 가질 뿐만 아니라, 추가적인 계산 자원을 효과적인 능력으로 전환하는 데도 더 능숙할 수 있습니다.
Brown은 모델의 능력이 향상됨에 따라 효과적으로 작동할 수 있는 작업 주기도 길어질 것으로 추측합니다. 과거에는 상대적으로 제한된 예산 내에서 모델의 성능이 안정되는 것을 관찰할 수 있었지만, 미래에는 성능의 한계가 더 멀리 넓어질 수 있습니다. 특정 작업에서는 소위 “플랫폼 기간”(platform period)이 더 이상 쉽게 측정할 수 있는 상태가 되지 않을 수도 있습니다.
단일 점수에서 «성능-비용 곡선»으로의 전환
이러한 변화에 직면하여, 브라운(Brown)은 모델 출시 기관들이 벤치마크 테스트의 표현 방식을 변경할 것을 제안합니다.
최종 점수만 공개하는 것보다는, 가로축에 추론 계산량을 표시하고 세로축에 작업 성능을 나타내며 성능 변화 곡선을 그리는 것이 더 좋습니다. 가로축에는 토큰 수, 추론 비용 또는 실제 실행 시간과 같은 지표를 사용할 수 있습니다.
이 방법은 전통적인 성적표에서 설명하기 어려운 문제들에 대한 답을 제공할 수 있습니다. 예를 들어, 동일한 예산 하에서 어떤 모델이 더 좋은 성능을 보일까요? 예산이 10배 증가했을 때 어떤 모델이 더 빠르게 개선될까요? 모델이 그 성능의 한계에 가까워지고 있을까요? 다양한 모델들의 비용 효율성은 어떻게 변화할까요?
비슷한 방법들이 이미 일부 벤치마크 테스트에 사용되기 시작했습니다. 브라운(Brown)은 ARC-AGI 평가가 모델의 점수와 운영 비용 간의 관계를 측정하려고 시도한다고 언급했는데, 단순히 단일 점수를 발표하는 것이 아닙니다.

또 다른 실현 가능한 방안은 평가를 위해 명확한 계획 토큰, 비용 또는 시간 제한을 설정하고, 모델에 예산 정보를 사전에 알려주는 것입니다. 이 방식은 인간이 표준화된 시험에 참가하는 것과 유사합니다. 예를 들어, 미국 대학 입학 시험인 SAT나 국제 수학 올림피아드에서 참가자들은 정해진 시간 내에 과제를 완료해야 합니다. 모델의 능력도 통일된 제약 조건 하에서 비교될 수 있습니다.
하지만 브라운(Brown)은 동시에 다양한 지표들이 제한적이라고 지적했습니다.
"""다른 모델들이 사용하는 분석 도구(분절화 도구), 생성 속도, 그리고 측정 단위가 다르기 때문에, 모델 간에 토큰의 수를 직접 비교하는 것은 어려울 수 있습니다. 토큰의 비용도 각기 다를 수 있습니다. 비용은 하드웨어 사용률, 대량 처리 능력, 그리고 엔지니어링 구현 방식에 따라 영향을 받습니다. 실행 시간이 완벽한 지표가 아니기 때문에, 실행 시간 역시 완벽한 기준이 아닙니다. ‘다중 에이전트 협력’이나 ‘best-of-N’과 같은 기술을 사용하면 여러 개의 후보 답안을 동시에 생성할 수 있지만, 이는 사용자가 느끼는 대기 시간을 반드시 크게 줄이지는 않을 수 있습니다. 하지만 동시에 전체 계산량은 상당히 증가할 수 있습니다."
그럼에도 불구하고, 그는 위의 어떤 지표도 추론 예산을 벗어난 단일 점수보다 더 많은 정보를 담고 있다고 생각합니다.
추론 예산 문제가 인공지능 보안 평가로 확장되고 있습니다.
Brown의 논의는 모델 목록에 국한되지 않습니다. 그는 추론 예산도 최첨단 모델의 보안 관리에 직접적인 영향을 미친다고 생각합니다.
"""최첨단 인공지능 모델을 출시하기 전에, R&D 기관들은 일반적으로 사이버 공격, 생물학적 위험, 화학적 위험 등 잠재적인 악용 가능성을 평가합니다. 모델이 특정 위험 임계값에 도달한 경우, R&D 기관은 출시를 연기하거나 배포 전에 접근 제한, 모니터링 메커니즘과 같은 완화 조치를 추가해야 할 수 있습니다."
문제는, 모델의 능력이 추론 계산량이 증가함에 따라 향상된다면, 보안 평가에 얼마나 많은 추론 예산을 사용해야 하는가 하는 것입니다.
사실, 일반 사용자는 한 가지 작업에 몇 달러나 몇 십 달러만 투자할 수 있습니다. 하지만 자금이 충분한 조직, 전문 팀 또는 국가 행위자는 일반 사용자보다 훨씬 더 많은 자원을 단일 목표에 투자할 의향이 있을 수 있습니다. 평가 기관이 낮은 예산으로만 모델을 테스트한다면, 고자원 환경에서의 위험 감수 능력을 과소평가할 수 있습니다.
Brown은 Gemini 3 Deep Think의 출시 후 논란을 예로 들었습니다. 그는 Deep Think의 벤치마크 결과가 이전 모델들보다 현저히 높았지만, 해당 버전의 위험 수준을 충족시키기 위한 완전한 시스템 정보가 함께 제공되지 않았다고 지적했습니다. 이러한 접근 방식은 일부 인공지능 보안 연구자들의 비판을 받았습니다.


하지만 Brown 논란의 이면에는 더 깊은 문제가 있는 것으로 보입니다: 인공지능 기업과 보안 기관들은 아직 다양한 추론 예산 하에서 모델의 능력을 평가하는 일관된 방법을 확립하지 못했습니다.
그는 Deep Think가 완전히 독립적으로 훈련된 새로운 모델이 아니라, 기존 모델들을 기반으로 한 추론 프레임워크 시스템일 가능성이 있다고 추측합니다. 이 시스템은 모델을 여러 번 호출하고, 후보 결과를 병렬적으로 생성하며, 답안을 자동으로 검증하고 반복적으로 수정함으로써 복잡한 작업의 성능을 향상시킬 수 있습니다.
만약 이러한 판단이 성립한다면, Deep Think 이론적으로는 플랫폼 자체만으로도 보여진 기능들을 구현할 수 있습니다. 외부 개발자들이 충분한 추론 비용을 투자할 의향이 있다면, 여러 모델을 결합하여 유사한 워크플로우를 구축할 수도 있습니다. Deep Think의 역할은 본래 전문 개발자의 능력이 필요한 복잡한 추론 프로세스를 일반 사용자도 쉽게 호출할 수 있는 제품 형태로 패키징하는 데 있습니다.
따라서 Brown과 다른 사람들은 제품이 시스템 카드를 개별적으로 출시했는지 여부가 아니라, 연구 개발 기관이 다양한 추론 예산과 프레임워크 전략 하에서 기본 모델이 처음 출시될 때 달성할 수 있는 능력 수준을 충분히 테스트했는지가 더 중요하다고 생각합니다.
고예산 평가는 전면적으로 시행하기 어렵지만, 외삽법을 시도할 수는 있습니다.
이론적으로는 자원이 충분한 주체가 단일 작업에 1,000만 달러 이상의 추론 비용을 투자할 수 있습니다. 하지만 보안 평가는 보통 수천 번에서 수백만 번의 테스트를 포함합니다. 만약 모든 테스트에 매우 높은 예산을 사용한다면, 평가 비용은 곧 실현 가능성을 잃게 될 것입니다.
Brown은 상대적으로 통제 가능한 추론 예산 범위 내에서 먼저 테스트를 수행한 다음, 모델의 능력이 계산량의 변화에 따라 어떻게 변하는지를 바탕으로 더 높은 예산 조건에서의 성능을 추진할 수 있다고 제안했습니다. 또한, 평가 기관은 예측 범위와 불확실성을 명확하게 표시해야 하며, 계산 결과를 확정적인 결론으로 간주해서는 안 됩니다.

이 방법은 부분적인 데이터를 통해 더 큰 규모의 시스템의 변화 추세를 추정하는 것과 유사합니다. 이 방법은 실제 테스트를 대체할 수는 없지만, 연구 개발 기관과 규제 기관이 모델에 더 많은 시간, 도구, 계산 자원이 제공될 때 위험의 경계가 어떻게 변할 수 있는지 이해하는 데 도움을 줄 수 있습니다.
하지만 브라운(Brown)은 장기적인 작업이 여전히 단기 실험에서 해결하기 어려운 문제들을 야기할 수 있다고 인정했습니다.
예를 들어, 연구자들이 독립적인 지능체가 1년 동안 지속적으로 작동한 후에 목표에서 벗어나거나 전략적으로 속이거나 다른 부적합한 행동을 보일지 판단하고자 한다면, 가장 신뢰할 수 있는 방법은 여전히 그 지능체가 충분히 오랜 시간 동안 실제로 작동하도록 하는 것일 수 있습니다. 단지 몇 시간이나 며칠의 실험 결과만으로는 장기적인 행동에서의 중요한 변화를 포착하기 어려울 수 있습니다.
이것은 새로운 현실의 모순을 만들어낼 것입니다: 인공지능 모델의 개발 및 출시 주기는 몇 달밖에 되지 않을 수 있지만, 지능형 신체가 지속적으로 작동할 수 있는 작업 주기는 점점 더 길어질 수 있습니다. 미래에는 연구 개발 기관들이 특별한 상황에 직면할 수 있습니다. 즉, 차세대 모델이 그 최대 작동 주기를 다 채우기도 전에 출시될 가능성이 높아집니다.
세 가지 제안: 추론 예산을 모델 평가의 기본 변수로 만들기
Brown은 능력 평가와 보안 거버넌스에 관한 위의 문제들에 대해 세 가지 구체적인 제안을 합니다.
먼저, 인공지능 연구 개발 기관은 새로운 모델을 출시할 때 다양한 추론 예산 조건 하에서 벤치마크 성능을 공개해야 합니다. 이상적으로는 기업이 토큰 수, 비용 또는 실행 시간을 가로축으로 하는 성능 곡선을 제공해야 합니다. 적어도 기업은 단일 결과를 얻기 위해 실제로 얼마나 많은 추론 리소스가 사용되었는지를 설명해야 합니다.
둘째, 벤치마크 순위는 추론 리소스의 소비를 기록해야 하며, 참조 모델에 대해 통일된 토큰, 비용 또는 시간 제한을 설정해야 합니다. 현재 일부 평가에서는 관련 변수가 포함되어 있지만, 이 업계에서는 아직 표준적인 관행이 형성되지 않았습니다.
셋째, 인공지능 기업의 준비 체계(Preparedness Framework)와 책임감 있는 확장 정책(Responsible Scaling Policy, RSP)의 추론 단계에서 사용되는 계산 자원은 명확히 고려되어야 합니다. 기관이 모델이 특정 보안 임계값을 초과하는지 판단할 때, 단일 구성에서의 성능만을 검토하는 것이 아니라 여러 추론 예산 수준을 평가하고, 더 높은 예산 조건에서의 위험 능력에 대한 불확실성을 예측해야 합니다.
해당 업계는 이미 이 문제를 인식하고 있지만, 평가 시스템은 아직 완전히 따라잡지 못하고 있습니다.
추론 단계에서 계산 리소스를 추가하면 모델 성능을 향상시킬 수 있다는 것은 새로운 발견이 아닙니다.
OpenAI가 2024년 9월에 o1 추론 모델을 출시한 이후, 업계에서는 이 모델이 질문에 답변할 때 더 많은 추론 단계를 거친다고 일반적으로 인식하고 있으며, 수학, 코드, 복잡한 분석 작업에서 더 좋은 성능을 낼 수 있다고 여겨집니다. “계산 테스트 시의 확장성”이나 “계산 추론 시의 확장성”에 대한 연구도 점차 대형 모델 개발의 중요한 방향으로 부상하고 있습니다.
하지만 브라운(Brown)에 따르면, 이러한 추세가 나타난 지 거의 2년이 지난 후에도 많은 최첨단 모델들이 여전히 단일한 벤치마크 점수에 의존하여 홍보되고 비교되고 있습니다. 일부 보안 기관들은 스태킹 시스템에서 수십 배 또는 수백 배의 추론 예산을 사용한 후에도 모델의 능력 한계를 재평가할 수 있습니다.
모델들이 장기간의 실행, 다단계의 시행착오, 대규모 추론 자원을 더 잘 활용할 수 있게 됨에 따라, 전통적인 평가 방법들의 유효성은 계속해서 줄어들 수 있습니다. 저예산의 질문응답, 고예산의 심층 연구, 다중 지능의 협업, 자동화 도구의 호출과 같은 다양한 조건에서 동일한 기본 모델이 완전히 다른 수준의 능력을 보일 수 있습니다.
Brown은 미래에 인공지능의 능력을 측정할 때, 추론 예산을 테스트 과정의 보조 정보로 간주해서는 안 되며, 모델의 규모, 훈련 데이터, 상황별 맥락과 같은 평가 보고서의 핵심 요소로 삼아야 한다고 주장합니다.
더 넓은 관점에서 보면, 이는 인공지능 산업이 “단 하나의 숫자로 모델을 정의하는” 단계를 점차 벗어나고 있음을 의미합니다. 능력 평가, 제품 비교, 보안 관리 측면에서 진정으로 중요한 것은 모델이 무엇을 할 수 있는가가 아니라, 충분한 시간, 자금, 계산 자원을 확보했을 때 얼마나 많은 것을 할 수 있는가입니다.
참조 링크: https://x.com/polynoamial/status/2064210146558136827
저자는 “기계의 마음”의 “기계의 마음 편집부”에서 왔습니다.
도움이 되었나요?