• Noam Brown, scientifique d'OpenAI : la véritable limite supérieure de l'IA, personne ne peut se permettre de la mesurer

    Alors que les grands modèles linguistiques commencent à être utilisés pour des tâches complexes telles que la raisonnement, la recherche automatisée et la sécurité des réseaux, les méthodes traditionnelles d'évaluation des modèles font face à de nouveaux défis.Depuis longtemps, la publication de modèles est accompagnée d'une table de résultats composée de divers tests de benchmark, incluant des tests en mathématiques, en programmation, en questions scientifiques, en sécurité informatique et en raisonnement cognitif, et ces résultats sont comparés horizontalement avec ceux de la génération précédente de modèles.

    Noam Brown, scientifique d'OpenAI : la véritable limite supérieure de l'IA, personne ne peut se permettre de la mesurer
  • Claude devient stupide pendant qu 'il fait de la recherche sur l'IA, et Anthropic est assiégé par la communauté de recherche.

    Claude Fable 5 est le sujet central de l'actualité dans le domaine de l'IA aujourd'hui, ce modèle « de niveau mythique » présente des performances exceptionnelles et a attiré une immense attention.Andrej Karpathy a qualifié cela de « très excitant » et a décrit cela comme un « progrès significatif justifiant une mise à niveau majeure », au même niveau que les améliorations apportées par Claude 4.5 en novembre dernier. Dans le benchmark de programmation SWE-bench Pro, Fable 5 a obtenu une note de 80,3 %, dépassant Opus 4.8 de 11 points de pourcentage. Avec un codebase de 50 millions de lignes en Ruby, Fable 5 a réussi à migrer l’ensemble du codebase en une seule journée, tandis qu’une équipe humaine mettrait plus de deux mois pour accomplir la même tâche.

    Claude devient stupide pendant qu 'il fait de la recherche sur l'IA, et Anthropic est assiégé par la communauté de recherche.
  • GPT-5.6 Les premières mesures sont arrivées ! Sniper de précision Mythos

    Just now, Anthropic released the “Big Killer” that it had been working on for two months—Claude Fable 5etMythos 5C'est comme lancer une bombe.Mettre directement la pression sur OpenAI.

    GPT-5.6 Les premières mesures sont arrivées ! Sniper de précision Mythos

Aucun autre contenu