GPT-5.6 첫 번째 테스트가 도착했습니다!정밀 저격수 Mythos
방금, Anthropic이 두 달 동안 숨겨왔던 ‘대형 킬러’를 공개했습니다—Claude Fable 5그리고Mythos 5마치 폭탄을 던진 것처럼.
지금 바로 OpenAI에 압력을 가하자.

동시에, GPT-5.6도 유출되었습니다.
OpenAI는 지난주부터 내부 코드를 테스트해 왔습니다.kepler그리고kindle두 개의 새로운 체크포인트가 있습니다. Kindle Alpha의 공개가 출시 후보로 선정되었습니다.

GPT-5.6의 내부 테스트 버전이 해외 개발자들과 유출 커뮤니티에서 열렬히 테스트되고 있습니다. 코드, 후보 버전, 그리고 게임 플레이에 대한 정보들이 모두 공개되었습니다.

IPO를 놓고 경쟁하든, 주력 모델이 충돌하든, 두 회사는 모두 “나도 신청서를 제출할 거야, 네 신청서도 제출할 거야”라고 말합니다. “네가 새 모델을 내놓으면, 나도 새 모델을 내놓을 거야.”
순수함이란 서로 치열하게 싸우는 것을 의미합니다.
하지만 문제는, GPT-5.6가 정말로 Mythos를 이길 수 있을까요??

GPT-5.6가 드러났습니다.
지금까지 OpenAI가 GPT-5.6와 대결한 것에 대한 공식 발표는 없으며, 아직 공식적으로 출시되지도 않았습니다.
그러나 많은 해외 네티즌들은 이미 “내부 체크포인트” 프로브 테스트가 완료되었다는 것을 알고 있습니다.
소위 체크포인트(checkpoint)란 모델이 훈련 과정에서 특정 시점에 저장한 파라미터의 스냅샷을 말합니다.
OpenAI 내부에는 많은 체크포인트가 있으며, 이들을 비교한 후 “충분히 좋아서 공개할 수 있다”고 판단되는 버전을 출시 후보 버전(RC)으로 선정합니다.
지난주부터 OpenAI 내부에서는 ‘kindle’과 ‘kepler’라는 코드명으로 불리는 두 개의 새로운 체크포인트를 테스트하고 있습니다.kindle-alpha최종 후보 버전이 선정되어 발표되었습니다.

유출된 정보에 따르면, GPT-5.6에서 가장 자주 언급된 업그레이드는전면/UI 개발。
네트izens Pankaj Kumar의 말에 따르면, Kindle은 alpha의 프론트엔드 생성 능력을 크게 향상시켰습니다.더 강력한 인터페이스 출력을 직접 제공할 수 있으며, 복잡한 안내 문구나 추가적인 기술이 필요하지 않습니다.。

또한, 그것의 시각적 능력도 매우 좋아서 이미지 이해 및 이미지 인용 작업에서 우수한 성능을 보였으며, 추론, 인코딩, UI 생성 측면에서도 상당한 개선이 있었습니다.
이것은 네티즌 Chris가 Kindle의 성능을 측정한 결과로, medium 설정을 사용했습니다:

이것은 또 다른 네티즌이 이전에 non-reasoning 버전의 Joule에서 측정한 결과입니다:

전자가 훨씬 더 정교하다는 것을 알 수 있습니다.
하지만 네티즌 Leo는 동일한 prompt, Kepler, Kindle을 사용하여 xhigh 설정에서 각각 측정했습니다.
Kepler와 비교했을 때, Kindle이 여전히 퇴보하고 있는 것으로 나타났습니다.

음.. 이런 효과는 정말로 평가하기가 어렵네요.
그는 OpenAI가 계속해서 개선될 가능성이 매우 높다고 판단했습니다.최종적으로 Kindle를 후보 버전으로 사용하지 않을 가능성도 배제할 수 없습니다.。
최신 소식에 따르면, Kindle가 Arena에서 제외되었으며 새로운 모델이 출시되었습니다.Levi。
일부 네티즌들은 Levi가 GPT-5.6의 내부 버전 코드일 수도 있다고 추측하며, 그것을 GPT-5.5의 프론트엔드 기능과 비교했습니다:

이로 보아 Levi의 프론트엔드도 상당히 괜찮은 편이며, 스타일이 신선하고 단순하며 고급스러운 느낌을 줍니다. 디테일 처리도 매우 잘 되어 있습니다.
하지만 일부 네티즌들은 Levi가 Meta에서 온 것일 수도 있다고 생각하고 있으며, GPT-5.6는 아닐 수도 있다고 합니다.

그렇다면, GPT-5.6가 과연 Mythos를 이길 수 있을까요?
네티즌 mark_k는 GPT-5.6가 “여러 agentic들이 Mythoss의 코딩 벤치마크를 뛰어넘었다”고 주장합니다.

하지만 현재 더 설득력 있는 것은 앞서 보여진 네티즌 Leo의 실제 테스트 결과입니다. 그는 GPT-5.6의 상황이 그리 낙관적이지 않다고 생각합니다:
Kepler와 비교했을 때, Kindle는 퇴보한 것입니다. 현재의 상태로는Mythos에 쉽게 패배할 수 있습니다.。
6월에는 ‘오토 삼각관계’에서 ‘스피드 앤 더 레이싱’이 펼쳐질 예정입니다.
6월이 되면서 여름이 찾아왔고, 대형 모델 분야도 활기를 띠기 시작했습니다.
해외의 세 대표적인 AI 모델인 Fable 5, Gemini 3.5 Pro, GPT-5.6가 모두 같은 시기에 출시되어 “생사를 건 경쟁”을 펼쳤습니다.
이들 모델은 추론, 에이전트, 코딩, 프론트엔드 생성과 같은 동일한 기능을 갖추고 있습니다.
흥미롭게도, 세 회사 모두 6월에 이러한 모델들을 출시했지만,지금까지 실제로 결과를 공개한 회사는 A사뿐입니다.。
Gemini 3.5 Pro는 5월 19일에 열린 구글 I/O 컨퍼런스에서 공개되었으며, 200만 개의 토큰을 기반으로 한 컨텍스트 처리와 Deep Think 추론 기능에 중점을 두고 있습니다.
하지만 아직 공식적으로 출시되지는 않았으며, 관계자들은 6월에 정식으로 사용할 수 있도록 할 계획입니다.
GPT-5.6, 해당 메시지는 이달 말에 공개될 예정입니다.
이것은 OpenAI의 상황에도 긴장감을 더하고 있습니다: 경쟁자들이 이미 점수를 공개했으며, 내부적으로 어떤 RC 버전을 제출해야 할지 고민하고 있을 것입니다.
하지만 점수를 내는 것 외에도,가격 책정또한 중요한 요소입니다.
Fable5.Mythos5개 품목의 통일 가격 책정Token10미국 달러,Token50달러입니다.
현재 Opus의 약 두 배에 해당합니다.
만약GPT-5.6능력 면에서는 Mythos와 비슷하거나 약간 떨어질 수 있지만, 가격이 훨씬 저렴하기 때문에 실제 사용률 측면에서는 한 도시를 되찾을 가능성이 있습니다.
현재 OpenAI는 공식적인 발표를 하지 않았으며, 실제 대결은 아직 기다려봐야 합니다.GPT-5.6정식 버전과 Fable의 공개 벤치마크 점수가 나온 순간입니다.
이번 달에 결과가 나올 가능성이 높으니, 많은 기대 부탁드립니다~
참고 링크:
[1]https://x.com/mark_k/status/2063922897341567488?s=20
[2]https://x.com/AiBattle_/status/2064078302394917157?s=20
[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20
[4]https://x.com/synthwavedd/status/2063245096951160865?s=20
[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20
[6]https://x.com/koltregaskes/status/2062806155139912164?s=20
저자는 “양자비트”의 “청우”입니다.
도움이 되었나요?