• OpenAI 과학자 Noam Brown : AI 의 진정한 한계는 아무도 측정 할 수 없습니다.

    대형 언어 모델들이 점차 복잡한 추론, 자동화 연구, 네트워크 보안과 같은 어려운 과제에 도전하면서, 전통적인 모델 평가 방법들은 새로운 도전에 직면하고 있습니다.오랫동안 모델의 출시는 수학, 프로그래밍, 과학적 질문응답, 네트워크 보안, 지식 추론 등 다양한 벤치마크 테스트 결과로 구성된 보고서와 함께 이루어졌으며, 이전 세대의 모델들과 수준을 비교해 왔습니다.

    OpenAI 과학자 Noam Brown : AI 의 진정한 한계는 아무도 측정 할 수 없습니다.
  • AI 연구를 할 때 클라우드가 몰래 멍청해지고 Anthropic 은 연구 커뮤니티에 포위당합니다.

    Claude Fable 5는 오늘날 AI 분야의 핵심 화제로, 이 “신화적인” 모델의 성능이 매우 뛰어나서 수많은 관심을 받고 있습니다.Andrej Karpathy는 이를 “매우 흥미진진하다”고 평가하며, “대규모 업그레이드에 걸맞는 도약적인 진전”이라고 말했습니다. 이는 지난 11월 Claude 4.5에서 이루어진 개선과 동일한 수준입니다. SWE-bench Pro 프로그래밍 벤치마크에서 Fable 5는 80.3%의 점수를 기록하여 Opus 4.8보다 11%나 높은 성능을 보였습니다. 5천만 줄의 코드를 가진 Ruby 코드베이스에서 Fable 5는 하루 만에 전체 코드베이스의 마이그레이션을 완료했는데, 같은 작업을 인간 팀에게 맡긴다면 2개월 이상의 시간이 걸릴 것입니다.

    AI 연구를 할 때 클라우드가 몰래 멍청해지고 Anthropic 은 연구 커뮤니티에 포위당합니다.
  • GPT-5.6 첫 번째 테스트가 도착했습니다!정밀 저격수 Mythos

    방금, Anthropic이 두 달 동안 숨겨왔던 ‘대형 킬러’를 공개했습니다—Claude Fable 5그리고Mythos 5마치 폭탄을 던진 것처럼.지금 바로 OpenAI에 압력을 가하자.

    GPT-5.6 첫 번째 테스트가 도착했습니다!정밀 저격수 Mythos
  • Claude Fable 5 프롬프트 단어 유출, 6 시간 효과 실측, 정말 죽여 미친?

    Fable 5가 막 출시되었는데, 시스템 힌트 문구가 이미 유출되었습니다:이 힌트 단어를 보면 몇 가지 중요한 점이 있습니다:첫째, Fable은 Artifact에 지속적인 저장 기능을 제공하는 API(window.storage)를 추가했습니다. Artifact란 Claude 코드로 생성된 고유한 콘텐츠, 예를 들어 HTML 페이지나 React 컴포넌트 등을 말합니다. 이전에는 Artifact 데이터를 저장할 수 없어서 일회성 데모와 같았습니다. 이제는 데이터를 세션 간에 저장할 수 있게 되었으며, 순위표, 출석 기록기, 일기와 같이 “기억을 가진” 작은 도구들을 지원할 수 있게 되었습니다.

    Claude Fable 5 프롬프트 단어 유출, 6 시간 효과 실측, 정말 죽여 미친?
  • 성장세를 보이는 음성 AI 분야에서 스타트업 팀인 Hojo가 등장했습니다.

    Voice AI는 일반적인 대형 모델과는 다른 이야기의 흐름입니다. 모두가 일반적인 대형 모델에 주목하는 동안, 비교적 조용했던 Voice AI 분야에서도 주목할 만한 새로운 모델들이 등장하기 시작했습니다. 키보드는 그것의 “지배적인 위치”를 잃어가고 있습니다. 지난 2년 동안, OpenAI는 Realtime API를 출시했고, Google은 Gemini Live를 개발했으며, 국내의 대형 모델 회사들도 거의 모두 Voice AI 분야에 진출하기 시작했습니다. 점점 더 많은 사람들이 Agent가 실제로 작업 흐름에 통합될 때, 음성이 키보드보다 더 자연스러운 상호작용 수단이 될 것이라고 믿기 시작했습니다. Agent가 실제로 작업 흐름에 통합되려면, 먼저 이러한 음성을 이해하는 법을 배워야 합니다. 그리고 이를 위한 첫 번째 능력은 ASR(자동 음성 인식)입니다. ASR의 수준을 측정할 때 업계에서 가장 자주 사용되는 것은 Hugging Face의 Open ASR Leaderboard이며, 핵심 지표는 단어 오류율(WER)입니다. 숫자가 낮을수록 인식 정확도가 높습니다.

더 이상 없습니다