Menú

¡GPT-5.6 ha llegado el primer lote de mediciones! El Sniper Mythos

Just ahora, Anthropic lanzó su gran “asesino” que ha estado en desarrollo durante dos meses…Claude Fable 5yMythos 5Es como lanzar una bomba.


Ahora ejercemos presión directamente sobre OpenAI.



Al mismo tiempo, GPT-5.6 también se filtró.


OpenAI ha estado probando su código interno desde la semana pasada.keplerykindleDos nuevos puntos de control. Kindle-alpha ha sido seleccionado como candidato para su lanzamiento.



La versión de prueba interna de GPT-5.6 ha comenzado a ser ampliamente utilizada por desarrolladores en el extranjero y en círculos de divulgación de información técnica. El código, las versiones candidatas y los datos relacionados con la experiencia de uso del producto han sido revelados.



Ya sea en la lucha por una oferta pública inicial (IPO) o en el enfrentamiento entre sus modelos estrella, ambas compañías dicen cosas como: «Yo también presentaré mi solicitud; tú lanzas un nuevo modelo, y yo también lanzaré uno nuevo».


La pureza se refiere a una situación en la que las cosas están tan mezcladas que es imposible separarlas.


Pero la pregunta es, ¿realmente GPT-5.6 puede vencer a Mythos??



El término “GPT-5.6” ha emergido a la superficie.


Hasta ahora, OpenAI ha enfrentado a GPT-5.6 sin que haya ningún anuncio oficial, y aún no ha sido lanzado oficialmente.


Sin embargo, muchos usuarios de internet en el extranjero aún no han hecho saber públicamente que las pruebas con los probes de los «puntos de control internos» han finalizado.


Un punto de control (checkpoint) es una instantánea de los parámetros almacenada por el modelo en un determinado momento durante el proceso de entrenamiento.


Dentro de OpenAI, habrá muchas versiones del producto, que se compararán entre sí. Luego, se seleccionará una versión que sea «suficientemente buena» para ser publicada, y a esta se le llamará versión candidata a publicación (Release Candidate, RC).


Desde la semana pasada, OpenAI ha estado probando dos nuevos puntos de control internamente, con los nombres en clave Kindle y Kepler. Entre ellos...kindle-alphaLa versión candidata fue seleccionada para su publicación.



Según lo que se puede deducir de la información que fluye, la actualización que se ha mencionado repetidamente en esta ocasión es la que está relacionada con GPT-5.6.Generación de interfaz de usuario frontal。


Según lo que dice el usuario Pankaj Kumar, Kindle ha mejorado significativamente la capacidad de generación de código del lado del cliente (frontend) de Alpha.Puede generar una interfaz de salida más potente directamente, sin necesidad de palabras de提示 complejas o habilidades adicionales.。



Además, también tiene excelentes capacidades visuales, demostrando un buen rendimiento en tareas de comprensión e identificación de imágenes, así como en aspectos como la inferencia, la codificación y la generación de interfaces de usuario, donde se han logrado mejoras significativas.


Esto es el resultado de las mediciones realizadas por el usuario Chris con el Kindle, utilizando la configuración de potencia media:



Estos son los resultados que otro usuario midió anteriormente en la versión no de razonamiento de Joule:



Es evidente que el primero es mucho más refinado.


Pero el usuario Leo utilizó el mismo prompt, Kepler y Kindle para realizar las mediciones en la configuración de xhigh.


En comparación con Kepler, se ha descubierto que Kindle está retrocediendo.



Bueno... realmente es difícil evaluar este efecto.


Incluso considera que es muy probable que OpenAI continúe perfeccionándose.No se descarta la posibilidad de que en el futuro se deje de utilizar el Kindle como una de las opciones de versión.。


La última noticia es que el Kindle ha sido retirado de Arena y ha aparecido un nuevo modelo.Levi。


Algunos usuarios han especulado que Levi también podría ser...GPT-5.6El código de la versión interna, y asociarlo conGPT-5.5Se compararon las capacidades frontales de:



Como se puede ver, el frontend de Levi también es bastante bueno; tiene un estilo fresco y sencillo, con un toque de sofisticación, y los detalles están bien cuidados.


Pero algunos usuarios de internet han descubierto que Levi podría provenir de Meta, y no de GPT-5.6.



Entonces, ¿puede realmente GPT-5.6 vencer a Mythos?


El usuario mark_k afirma que GPT-5.6 «múltiples agentes superaron los criterios de evaluación de codificación de Mythoss».



Pero lo que es más convincente en este momento son las pruebas reales realizadas por el usuario Leo que se mostraron anteriormente. Él cree que la situación de GPT-5.6 no es optimista:


En comparación con Kepler, el Kindle representa un paso atrás. En su forma actual,Es muy fácil ser derrotado por Mythos.。


En junio, las tres familias imperiales protagonizaron “Velocidad y Pasión”.


En junio, llegó el verano, y también se ha animado el mundo de los grandes modelos (grandes modelos de IA).


Los tres modelos líderes en IA del extranjero fueron lanzados al mismo tiempo: Fable 5, Gemini 3.5 Pro.GPT-5.6Se llevó a cabo una escena de "velocidad entre la vida y la muerte".


Y además, se está jugando con el mismo conjunto de capacidades: razonamiento, agentes inteligentes, codificación y generación de interfaces frontales.


Curiosamente, aunque las tres compañías pusieron énfasis en ese aspecto en junio,Hasta ahora, solo la empresa A ha entregado sus trabajos realmente.。


Gemini 3.5 Pro fue presentado en la conferencia Google I/O el 19 de mayo, y se centra en el manejo de contextos de hasta 2 millones de tokens, así como en el proceso de razonamiento denominado Deep Think.


Pero aún no ha sido lanzado oficialmente; la fecha oficial de disponibilidad está programada para junio.


GPT-5.6, el mensaje se hará público más tarde este mes.


Esto también añade una capa de tensión a la situación de OpenAI: el oponente ya ha publicado sus puntuaciones, y internamente todavía podrían estar debatiendo sobre qué versión de RC (Release Candidate) enviar.


Pero además de realizar las pruebas de rendimiento («running benchmarks»),PreciosTambién es un factor importante.


Fable5.Mythos5 Precios unificadosToken10Dólares,Token50Dólares.


Es aproximadamente el doble del tamaño del Opus actual.


Si GPT-5.6 tiene las mismas capacidades que Mythos, o incluso una ligera disminución, pero a un precio mucho más bajo, todavía es posible que aumente su utilidad práctica en una ciudad.


Actualmente, OpenAI no ha hecho ningún anuncio oficial; el verdadero duelo tendrá lugar cuando la versión final de GPT-5.6 y Fable realicen sus pruebas de rendimiento de manera directa.


Es muy probable que se aclare este mes, ¡estén atentos!


Enlaces de referencia:

[1]https://x.com/mark_k/status/2063922897341567488?s=20

[2]https://x.com/AiBattle_/status/2064078302394917157?s=20

[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20

[4]https://x.com/synthwavedd/status/2063245096951160865?s=20

[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20

[6]https://x.com/koltregaskes/status/2062806155139912164?s=20


El autor proviene de “Qubit” y se llama “Ting Yu”.

¿Te ha resultado útil?

Soporte técnicoSoporte en línea
侧栏
Volver arriba
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR