Menu

GPT-5.6 O primeiro lote de medições reais chegou! Sniper de precisão Mythos

Ontem, a Anthropic lançou o seu “grande assassino”, que estava em desenvolvimento há dois meses…Claude Fable 5EMythos 5É como se tivesse jogado uma bomba.


Agora vamos exercer pressão direta sobre a OpenAI.



Ao mesmo tempo, o GPT-5.6 também foi vazado.


OpenAI começou a testar seu código interno na semana passada.keplerEkindleDois novos pontos de verificação. O Kindle-Alpha foi selecionado como candidato para lançamento.



GPT-5.6A versão de teste interna começou a ser amplamente testada por desenvolvedores estrangeiros e no círculo de vazamentos de informações. O código, as versões candidatas e as informações sobre o funcionamento do sistema foram todos divulgados.



Seja na disputa por uma IPO ou no colisão de seus modelos principais, as duas empresas dizem coisas como “Eu também vou enviar a minha proposta” e “Você lança um novo modelo, eu também lanço um novo modelo”.


Pureza significa lutar até não haver mais espaço para recuar.


Mas a questão é: o GPT-5.6 realmente consegue derrotar o Mythos??



GPT-5.6 veio à tona


Até agora, a OpenAI enfrentou o GPT-5.6 sem nenhum anúncio oficial, e isso ainda não foi divulgado oficialmente.


No entanto, muitos internautas estrangeiros ainda não sabem que os testes com os probes dos “pontos de verificação internos” foram concluídos.


Um checkpoint, como o nome indica, é um snapshot dos parâmetros de um modelo que é armazenado em um determinado ponto no processo de treinamento.


Dentro da OpenAI, haverá muitas versões diferentes, que serão comparadas entre si. Em seguida, uma versão que seja considerada “suficientemente boa para ser divulgada” será selecionada e chamada de Versão Candidata a Lançamento (Release Candidate – RC).


Desde a semana passada, a OpenAI está testando internamente dois novos pontos de verificação, codinados como “kindle” e “kepler”.kindle-alphaA versão candidata foi selecionada para publicação.



De acordo com as informações divulgadas, a atualização mais frequentemente mencionada em relação a GPT-5.6 é...Geração de frontend/UI。


De acordo com o que o internauta Pankaj Kumar disse, o Kindle melhorou significativamente a capacidade de geração de código front-end do Alpha.É possível produzir uma interface mais atraente diretamente, sem a necessidade de palavras de incentivo complexas ou habilidades adicionais.。



Além disso, sua capacidade visual também é muito boa, com um desempenho excelente em tarefas de compreensão e referência de imagens, além de melhorias significativas em raciocínio, codificação e geração de interfaces gráficas (UI).


Este é o resultado da medição feita pelo internauta Chris no Kindle, utilizando a configuração de potência média:



Este é o resultado medido por outro usuário no Joule (versão não de raciocínio) anteriormente:



É visível que o primeiro é muito mais refinado.


Mas o internauta Leo utilizou o mesmo prompt, Kepler e Kindle para realizar as medições nas configurações de nível xhigh.


Comparado com o Kepler, descobriu-se que o Kindle ainda está regredindo.



Bem... é realmente difícil avaliar esse efeito.


Ele até acredita que é muito provável que a OpenAI continue a aprimorar seus produtos e serviços.Não se exclui a possibilidade de o Kindle ser eventualmente descartado como uma das opções em consideração.。


As últimas notícias são que o Kindle foi removido da Arena e um novo modelo foi lançado.Levi。


Alguns usuários especulam que "Levi" também pode ser o código de uma versão interna de "GPT-5.6" e compararam suas capacidades front-end com as de "GPT-5.5":



Como podemos ver, a parte frontal (frontend) do Levi também é bastante boa, com um estilo fresco e simples, cheio de sofisticação, e os detalhes são bem cuidados.


No entanto, alguns usuários da internet descobriram que Levi pode ser de origem Meta, e não de GPT-5.6.



Então, será que o GPT-5.6 consegue derrotar o Mythos?


O internauta mark_k afirma que o GPT-5.6 "vários agentes superaram os benchmarks de codificação do Mythoss".



Mas no momento, o que é mais convincente são os testes reais realizados pelo internauta Leo, apresentados anteriormente. Ele acredita que a situação com GPT-5.6 não é nada otimista:


Comparado com o Kepler, o Kindle é um retrocesso. Na sua forma atual,É muito fácil ser derrotado pelo Mythos.。


Em junho, as três grandes famílias realizaram uma apresentação de "Velocidade e Paixão"


Em junho, o verão chegou, e o mundo dos grandes modelos também ficou mais animado.


Os lançamentos dos três principais modelos de IA no exterior coincidiram: Fable 5, Gemini 3.5 Pro e GPT-5.6, criando uma verdadeira “corrida contra o tempo”.


E o que está sendo jogado são o mesmo conjunto de capacidades: raciocínio, agentes inteligentes, codificação, geração de front-end.


Interessantemente, embora as três empresas tenham concentrado seus esforços nos nós em junho,Até agora, apenas a empresa A é a única que realmente entregou os trabalhos.。


O Gemini 3.5 Pro foi apresentado no Google I/O em 19 de maio, com foco no processamento de contextos com 2 milhões de tokens e no raciocínio por meio da tecnologia Deep Think.


Mas ainda não foi lançado oficialmente; a data oficial de disponibilidade é junho.


GPT-5.6, a notícia foi divulgada no final deste mês.


Isso também adiciona uma camada de tensão à situação da OpenAI: o adversário já divulgou as pontuações, e internamente eles provavelmente ainda estão discutindo qual versão do RC (Release Candidate) deve ser enviada.


Mas além de fazer as medições de desempenho (runnings scores),PreçosÉ também um fator importante.


O preço fixo da Fable 5.Mythos 5 é Token10 em dólares americanos e Token50 em dólares americanos.


Cerca de o dobro do tamanho do Opus atual.


Se o GPT-5.6 tiver capacidades comparáveis às do Mythos, ou até mesmo ligeiramente inferiores, mas por um preço muito mais baixo, ainda é possível que ele consiga aumentar a taxa de utilização real em uma cidade~


Atualmente, a OpenAI ainda não emitiu nenhum anúncio oficial; a verdadeira disputa só acontecerá no momento em que a versão final de GPT-5.6 e o Fable forem oficialmente comparados em desempenho.


Este mês é muito provável que a resposta seja conhecida, fiquem atentos!


Referências:

[1]https://x.com/mark_k/status/2063922897341567488?s=20

[2]https://x.com/AiBattle_/status/2064078302394917157?s=20

[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20

[4]https://x.com/synthwavedd/status/2063245096951160865?s=20

[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20

[6]https://x.com/koltregaskes/status/2062806155139912164?s=20


O autor é de "Quantum Bit" e se chama "Ting Yu".

Isso foi útil?

Suporte técnicoAtendimento online
侧栏
Voltar ao topo
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR