Ноам Браун, ученый OpenAI: истинный предел ИИ, который никто не может себе позволить измерить
По мере того как большие языковые модели все чаще применяются для решения сложных задач, таких как сложные рассуждения, автоматизированные исследования и обеспечение кибербезопасности, традиционные методы оценки моделей сталкиваются с новыми вызовами.
На протяжении долгого времени публикация моделей сопровождалась предоставлением таблиц результатов, включающих различные бенчмарки для проверки их производительности в таких областях, как математика, программирование, научные вопросы, кибербезопасность и рассуждение на основе знаний, а также сравнением этих результатов с производительностью предыдущих поколений моделей.

Исследователь OpenAI Ноам Браун недавно отметил в этой статье, что когда модели используют больше шагов рассуждения при ответе на вопросы, вызывают больше инструментов или проводят более длительные поиски и тестирования, единый балл все труднее точно отражает реальные возможности модели.

Основные выводы Брауна следующие:Производительность больших моделей зависит не только от самих моделей, но и от количества вычислительных ресурсов, доступных им на этапе рассуждения.При оценке моделей в будущем мы не должны задаваться только вопросом: «Сколько баллов получила модель?», нам также следует ответить на другой вопрос: сколько токенов потребовала модель для достижения этих результатов, и при каких затратах и времени на выполнение?
Он советует отрасли перейти от оценки «отдельных показателей» к анализу «кривой объема вычислений для выполнения интеллектуальных операций» и рассматривать бюджет на вычисления как важный фактор при оценке способностей моделей в рамках политики безопасности искусственного интеллекта.
Традиционные системы оценки могут недооценивать различия в способностях новых моделей.
Браун приводит в пример реакцию рынка после публикации модели с помощью токена GPT-5.5, чтобы показать ограничения традиционных методов ранжирования моделей.
Согласно его описанию,GPT-5.5В начальный период публикации внешний мир в первую очередь обратил внимание на набор не особенно заметных результатов базовых тестов.GPT-5.4В сравнении с предыдущей версией, результаты новой модели улучшились, однако согласно традиционным мерилам эффективности, степень улучшения кажется ограниченной. Поэтому некоторые пользователи относятся к новой версии с недоверием или даже сомнением.
Однако в течение нескольких часов после открытия модели некоторые пользователи заметили, что по мере того, как разработчики и исследователи начали тестировать более сложные задачи, параметр GPT-5.5 демонстрировал более заметные различия между поколениями моделей в области длинных цепочек рассуждений, непрерывного выполнения и решения сложных проблем. Браун считает, что это явление, когда «практический опыт значительно улучшается, но изменения в оценочных баллах ограничены», отражает то, что традиционные методы оценки не полностью способны отразить возможности модели.
Проблема в том, что результаты оценки различных моделей могут основываться не на одинаковом рассчитанном бюджете ресурсов для их работы.
В традиционных рамках оценки исследователи часто выбирают для каждой модели набор тестовых настроек с целью максимально улучшить результаты, а затем сравнивают окончательные баллы в одной и той же таблице. Это кажется справедливым, но может скрыть важный фактор: некоторые модели могут продолжать значительно улучшать свои показатели при получении большего количества интеллектуальных токенов, большего числа вызовов или при более длительном времени работы; в то время как другие модели могут достичь своего предела производительности гораздо раньше.
Исследования в области оценки кибербезопасности, представленные Brown, показывают, что если сравнивать только конечные результаты различных моделей при условии «расчета максимального объема данных во время тестирования» (условие GPT-5.5), преимущество модели GPT-5.5 по сравнению с моделью GPT-5.4 может не быть очевидным. Однако если количество примеров, затраты на обработку или задержки сопоставимы между моделями, то улучшения в производительности модели GPT-5.5 становятся более заметными.

Другими словами, различия между моделями проявляются не только в итоговых результатах, но и в эффективности использования дополнительных ресурсов для выполнения вычислений.
Почему нельзя поступить просто? «Продолжать добавлять ресурсы для обработки, пока производительность не достигнет плато»
Интуитивно понятное решение заключается в том, чтобы продолжать увеличивать количество ресурсов, предназначенных для обработки данных каждой модели, пока ее производительность не достигнет уровня стабильности (плато), а затем сравнить ее максимальные возможности с другими моделями.
Однако Браун считает, что такой подход может оказаться непрактичным на практике. Причина в том, что для новых поколений моделей период стабильной производительности может наступить гораздо позже, чем ожидалось, и его может быть трудно заметить даже в рамках реально доступного бюджета.
Он привел в качестве примера эксперименты по исследованию автоматизации, инициированные Андреем Карпати. В ходе этих экспериментов модель продолжала выполнять большое количество тестов, и её производительность продолжала улучшаться. Даже после сотен повторений экспериментов кривая улучшений оставалась довольно крутой (то есть темпы улучшений не были медленными).

Браун также упомянул результаты оценки кибербезопасности, проведенной Британским институтом исследований в области безопасности искусственного интеллекта (AI Security Institute). В ходе этой оценки было показано, что некоторые модели, включая Mythos и GPT-5.5, продолжали улучшать свои показатели после использования более 100 миллионов токенов.

Это явление означает, что модели могут использовать все больше времени на выполнение и все больший объем ресурсов для обработки данных, чтобы постоянно исследовать, пробовать и корректировать свои стратегии при выполнении сложных задач. Более мощные модели не только имеют лучшие начальные условия для работы, но и, возможно, лучше справляются с преобразованием дополнительных вычислительных ресурсов в реальные результаты.
По предположениям Брауна, по мере улучшения способностей моделей также увеличится и срок их эффективной работы. В прошлом, при относительно ограниченном бюджете, можно было наблюдать, что производительность моделей становилась стабильной; в будущем же верхний предел производительности, возможно, будет увеличен. В некоторых задачах так называемый «платформный период» может перестать быть легко измеримым показателем.
Переход от одного единичного показателя к «кривой производительности-стоимости»
В связи с этим изменением Браун советует организациям, выпускающим модели, изменить способ представления результатов бенчмаркинга.
Вместо того чтобы публиковать только один итоговый балл, лучше отобразить объем вычислений для решения задачи на горизонтальной оси и производительность задачи на вертикальной оси, а также нарисовать полную кривую изменения производительности. На горизонтальной оси можно использовать такие показатели, как количество токенов, затраты на решение задачи или фактическое время выполнения.
Этот метод позволяет ответить на вопросы, которые трудно объяснить с помощью традиционных таблиц результатов. Например, при одинаковом бюджете, какой модель показывает лучшие результаты? Как быстро улучшается производительность модели при увеличении бюджета в десять раз? Близка ли модель к своему потенциальному пределу? Как изменяется соотношение затрат и выгод различных моделей?
Подобные методы уже начали применяться в некоторых базовых тестах. Браун упомянул, что оценка ARC-AGI направлена на измерение взаимосвязи между результатами работы моделей и затратами на их выполнение, а не просто на публикацию единственного результата.

Другой возможный подход заключается в установлении четких критериев оценки, ограничений по затратам или времени, а также в заблаговременном предоставлении модели информации о бюджете. Этот метод схож с тем, как люди сдают стандартизированные экзамены: будь то вступительные экзамены в американские университеты SAT или Международные математические олимпиады, участники должны выполнить задания в установленные сроки. Таким образом, способности моделей также могут быть сравнены в условиях единых ограничений.
Однако Браун также отметил, что количество различных показателей ограничено.
Из-за того, что разные модели используют разные сегментаторы для разделения текста, разные скорости генерации результатов и разные единицы измерения, количество полученных результатов не может быть напрямую сравнено между моделями. Стоимость генерации результатов также может отличаться в зависимости от используемого оборудования, способов массовой обработки данных и конкретной реализации алгоритмов. Поскольку время выполнения программы не является идеальным показателем эффективности, оно тоже не может служить точным критерием оценки. Технологии типа «сотрудничества множества агентов» или алгоритмы выбора лучшего варианта (best-of-N) позволяют параллельно генерировать несколько возможных ответов, что не обязательно существенно увеличивает время ожидания пользователя, но при этом значительно увеличивает общий объем вычислений.
Несмотря на это, он считает, что любой из вышеупомянутых показателей содержит больше информации, чем простое число, отклоняющееся от расчетного бюджета на выполнение рассуждений (индекса рассуждений).
Проблема бюджета на выполнение рассуждений распространяется на оценку безопасности искусственного интеллекта.
Рассмотрения Брауна не ограничиваются лишь списками моделей; он считает, что бюджет на выполнение рассуждений также напрямую влияет на управление безопасностью передовых моделей искусственного интеллекта.
Перед публикацией передовых моделей искусственного интеллекта исследовательские и разработческие организации обычно оценивают потенциальные риски злоупотреблений, такие как возможности сетевых атак, биологические риски и химические угрозы. Если модель превышает определенные пороги риска, организациям может потребоваться отложить ее публикацию или внедрить дополнительные меры безопасности, такие как ограничения доступа и механизмы мониторинга.
Вопрос заключается в следующем: если способности модели улучшаются по мере увеличения объема вычислений, необходимо ли использовать определенный объем ресурсов (бюджета на вычисления) для оценки ее безопасности?
На самом деле обычные пользователи могут инвестировать всего несколько долларов или несколько десятков долларов в выполнение одной задачи. Однако организации с достаточными финансовыми ресурсами, профессиональные команды или государственные субъекты могут быть готовы вложить гораздо больше средств в достижение одной-единственной цели. Если организации, занимающиеся оценкой безопасности, тестируют модели при низком бюджете, они могут недооценить их способность к преодолению рисков в условиях больших ресурсов.
Браун приводит в качестве примера споров после выпуска модели Gemini 3 Deep Think. Он отмечает, что результаты базовых тестов Deep Think значительно превосходили показатели предыдущих версий моделей, однако при выпуске не была предоставлена полная информация о системе, необходимая для оценки её уровня безопасности. Такой подход вызвал критику со стороны некоторых исследователей в области безопасности искусственного интеллекта.


Однако, за спором вокруг Brown, по-видимому, стоит более глубокая проблема: компании, работающие в области искусственного интеллекта, и организации, занимающиеся обеспечением безопасности, еще не разработали стабильный метод для оценки способностей моделей при различных бюджетах на их обучение.
Он предполагает, что Deep Think, возможно, не является совершенно новой моделью, обученной независимо, а скорее системой-шаблоном для интеллектуальных вычислений, основанной на других существующих моделях. Эта система может повышать эффективность выполнения сложных задач путем многократного вызова модели, параллельного генерирования кандидатских решений, автоматической проверки ответов и итеративных корректировок.
Если это утверждение верно, то теоретически Deep Think не только сам по себе может реализовывать некоторые из показанных возможностей. Если внешние разработчики готовы вложить достаточно усилий в процесс рассуждений, они также могут объединить несколько моделей для создания подобных рабочих процессов. Основная цель Deep Think заключается в том, чтобы упростить использование сложных процессов рассуждений, которые обычно требуют специализированных навыков разработчиков, и сделать их доступными для обычных пользователей.
Таким образом, согласно мнению Брауна и других, настоящий вопрос, заслуживающий внимания, не в том, была ли системная карта выпущена отдельно от продукта, а в том, полностью ли исследовательские организации проверили уровень возможностей базовой модели на начальном этапе ее выпуска с учетом различных бюджетов на рассуждения и стратегий разработки.
Оценка с высоким бюджетом затруднена для полного выполнения, но можно попытаться провести экстраполяцию.
Теоретически, организация с достаточными ресурсами могла бы инвестировать более миллиона долларов в расчеты для выполнения одной задачи. Однако оценка безопасности обычно включает в себя тысячи или даже миллионы тестов. Если для каждой операции использовать очень большой бюджет, стоимость оценки быстро становится нерентабельной.
Браун предлагает сначала провести тестирование в рамках относительно контролируемого бюджета на размышления, а затем, исходя из тенденции изменения производительности модели в зависимости от объема вычислений, стремиться к более высоким бюджетным условиям. В то же время оценочные организации должны четко указывать пределы прогнозов и степень неопределенности, а не рассматривать результаты расчетов как окончательные выводы.

Этот метод аналогичен оценке тенденций изменений в более крупных системах на основе данных о небольших их частях. Он не может заменить фактические тесты, но может помочь исследовательским и регулирующим органам понять, как могут измениться границы рисков при предоставлении модели больше времени, инструментов и вычислительных ресурсов.
Однако Браун также признает, что долгосрочные задачи могут все еще приводить к проблемам, которые трудно решить в рамках краткосрочных экспериментов.
Например, если исследователи хотят определить, будет ли у независимого интеллектуального агента после года непрерывной работы отклонение от целей, стратегическое обманывание или другое несоответствие ожиданиям, то наиболее надежным методом, вероятно, по-прежнему будет позволить агенту работать достаточно долго. На основе результатов экспериментов, длительностью в несколько часов или дней, может быть невозможно выявить ключевые изменения в его долгосрочном поведении.
Это приведет к новому противоречию в реальности: цикл разработки и выпуска моделей искусственного интеллекта может составлять всего несколько месяцев, в то время как цикл выполнения задач с помощью интеллектуальных систем может увеличиваться. В будущем исследовательские организации могут столкнуться с особой ситуацией, когда следующее поколение моделей будет близко к выпуску еще до того, как истечет их максимальный срок службы.
Три рекомендации: сделать бюджет на рассуждения основной переменной при оценке моделей
В связи с вышеупомянутыми проблемами оценки способностей и управления безопасностью Браун предлагает три конкретных совета.
Во-первых, при публикации новых моделей организациями, занимающимися исследованиями и разработками в области искусственного интеллекта, следует предоставлять данные о базовых тестовых показателях эффективности при различных условиях расчетных ресурсов (ресурсов, необходимых для выполнения вычислений). В идеале компании должны представлять графики эффективности, на которых в качестве оси абсцисса отображается количество используемых токенов, затраты или время выполнения программы. Как минимум, компании необходимо объяснить, сколько ресурсов на вычисления было фактически потрачено для достижения конкретных результатов.
Во-вторых, рейтинги базовых тестов должны отражать потребление ресурсов для выполнения интеллектуальных процессов (расчетов), а также устанавливать единые ограничения на использование токенов, затраты или время для сравнения моделей. В настоящее время некоторые критерии оценки уже учитываются, но в данной отрасли еще не сформировались стандартные практики.
В-третьих, при разработке рамок подготовки для предприятий в области искусственного интеллекта (Preparedness Framework) и политики ответственного масштабирования (Responsible Scaling Policy, RSP) необходимо учитывать расчетные ресурсы, связанные с этапами вывода выводов (inference). Когда организация оценивает, превышает ли модель определенные критерии безопасности, необходимо не только проверять производительность в одной конфигурации, но и анализировать различные уровни бюджетов на выполнение вычислений, а также предсказывать степень риска при более высоких бюджетных условиях.
Эта отрасль уже осознала эту проблему, однако системы оценки еще не полностью соответствуют современным требованиям.
Увеличение вычислительных ресурсов на этапе рассуждений может повысить производительность модели, и это не является новым открытием.
С момента выпуска модели o1 от OpenAI в сентябре 2024 года, все в отрасли сходятся во мнении, что эта модель использует больше шагов рассуждения при ответе на вопросы, что позволяет ей добиваться лучших результатов в математических задачах, работе с кодом и выполнении сложных аналитических задач. Исследования, посвященные «расширяемости при выполнении вычислений» или «расширяемости рассуждений в процессе вычислений», также постепенно становятся важным направлением развития больших моделей.
Однако, по мнению Брауна, спустя почти два года после появления этой тенденции, публикация многих передовых моделей по-прежнему в основном осуществляется на основе единственного базового показателя для их распространения и сравнения. Некоторые организации в области безопасности также могут пересмотреть пределы возможностей моделей после использования в системах на десятки или даже сотни раз больших ресурсов для их обучения.
По мере того как модели становятся все более способными к длительному выполнению задач, многократному применению метода итеративных ошибок и использованию ресурсов для масштабных вычислений, качество интерпретации результатов традиционных списков может продолжать снижаться. В различных условиях — от вопросов с низким бюджетом до глубоких исследований с высоким бюджетом, от сотрудничества нескольких интеллектов до автоматизированного использования инструментов — один и тот же базовый модель может демонстрировать совершенно разные уровни производительности.
Браун считает, что в будущем при оценке способностей искусственного интеллекта бюджет на рассуждения не должен рассматриваться как вспомогательная информация в процессе тестирования, а должен стать ключевым параметром в отчетах об оценке, наряду с такими показателями, как масштаб модели, данные обучения и окно контекста.
С более широкой точки зрения, это также означает, что индустрия искусственного интеллекта постепенно отходит от этапа, когда один числовой показатель определял характеристики модели. Для оценки способностей, сравнения продуктов и обеспечения безопасности на самом деле важно не только то, что может сделать модель, но и то, на что она способна, если ей предоставить достаточно времени, ресурсов и вычислительных мощностей.
Контекст ссылки: https://x.com/polynoamial/status/2064210146558136827 Конец контекста ссылки: MG_SEG_212D938EA8D3_END
Автор приходится из “Сердца Машины” и из редакции “Сердца Машины”.
Ссылка на статью:https://airai.cc/ru/ai-news/10/
Было ли это полезно?