• Ноам Браун, ученый OpenAI: истинный предел ИИ, который никто не может себе позволить измерить

    По мере того как большие языковые модели все чаще применяются для решения сложных задач, таких как сложные рассуждения, автоматизированные исследования и обеспечение кибербезопасности, традиционные методы оценки моделей сталкиваются с новыми вызовами.На протяжении долгого времени публикация моделей сопровождалась предоставлением таблиц результатов, включающих различные бенчмарки для проверки их производительности в таких областях, как математика, программирование, научные вопросы, кибербезопасность и рассуждение на основе знаний, а также сравнением этих результатов с производительностью предыдущих поколений моделей.

    Ноам Браун, ученый OpenAI: истинный предел ИИ, который никто не может себе позволить измерить
  • Клод становится глупым во время исследования ИИ, а антропопик находится в осаде исследовательского сообщества.

    Claude Fable 5 является ключевой темой сегодняшнего дня в области искусственного интеллекта; этот «мифический» модель показывает выдающиеся результаты и привлекает огромное внимание.Андрей Карпати назвал это «очень волнующим» и «прорывным прогрессом, заслуживающим крупного обновления версии», который соответствует уровню улучшений, достигнутых в ноябре прошлого года с версией Claude 4.5. В тесте SWE-bench Pro Fable 5 получил 80.3% баллов, что на 11 процентных пунктов выше, чем у Opus 4.8. В кодовом репозитории, содержащем 50 миллионов строк кода на языке Ruby, Fable 5 смог завершить миграцию всего кода за один день, тогда как для выполнения той же работы командой людей потребовалось бы более двух месяцев.

    Клод становится глупым во время исследования ИИ, а антропопик находится в осаде исследовательского сообщества.
  • GPT-5.6 Первые испытания пришли!Точный снайпер Mythos

    Только что компания Anthropic выпустила свой главный продукт, который находился в разработке в течение двух месяцев —Claude Fable 5иMythos 5Это было похоже на бросок бомбы.Сейчас нужно напрямую оказать давление на OpenAI.

    GPT-5.6 Первые испытания пришли!Точный снайпер Mythos
  • Клод Фейбл 5 слова утечки, 6 часов эффекта проверен, действительно убивает сумасшедших?

    Fable 5 только что вышел на рынок, и уже сразу же были утечки системных сигналов (текстов, используемых системой для общения с пользователем):После прочтения этого подсказочного текста есть несколько ключевых моментов:Во-первых, Fable добавил API для постоянного хранения данных в Artifact (window.storage). Artifact представляет собой уникальный контент, генерируемый кодом Claude, такой как HTML-страницы, React-компоненты и т. д. Ранее данные Artifact нельзя было сохранить, и они использовались скорее как одноразовые демо-версии. Теперь данные могут сохраняться между сессиями, что позволяет создавать инструменты с функцией “памяти”, такие как рейтинги, системы отметки времени, дневники и т. д.

    Клод Фейбл 5 слова утечки, 6 часов эффекта проверен, действительно убивает сумасшедших?
  • На разогревающейся арене конкуренции в области голосового искусственного интеллекта появилась стартап-команда Hojo.

    Голосовый искусственный интеллект (Voice AI) представляет собой ещё один направление развития, отличное от общих больших моделей (general large models). В то время как все сосредоточены на общих больших моделях, на относительно тихом пути развития голосового искусственного интеллекта также появляются новые, заслуживающие внимания модели. Клавиатура теряет своё «доминирующее положение». За последние два года OpenAI выпустила Realtime API, Google создала Gemini Live, а китайские компании, занимающиеся разработкой больших моделей, также начали активно развивать технологии голосового искусственного интеллекта. Всё больше людей считают, что после того, как агенты (agents) действительно начнут использоваться в рабочих процессах, голос станет более естественным способом взаимодействия с пользователем по сравнению с клавиатурой. Чтобы агент действительно мог войти в рабочий процесс, он сначала должен научиться понимать человеческий голос. Первым этапом на этом пути является автоматическое распознавание речи (ASR – Automatic Speech Recognition). Для оценки уровня ASR в индустрии часто используется рейтинг Open ASR от Hugging Face, главным показателем которого является процент ошибок в распознавании слов (WER – Word Error Rate); чем ниже этот показатель, тем точнее распознавание речи.

Больше ничего нет