Запись архива

OpenAI представила фреймворк для оценки наблюдаемости цепочек рассуждений ИИ-моделей

Исследователи OpenAI опубликовали набор из 13 тестов для оценки того, насколько внутренние рассуждения языковых моделей поддаются мониторингу. Результаты показывают, что анализ цепочек мыслей значительно эффективнее проверки только финальных ответов, а масштабирование RL-обучения не ухудшает наблюдаемость.

Схема фреймворка OpenAI для оценки наблюдаемости цепочек рассуждений с тремя архетипами тестов
Схема фреймворка OpenAI для оценки наблюдаемости цепочек рассуждений с тремя архетипами тестов
Student Studying in ACES Library (11056201595).jpg | by University of Illinois Library | wikimedia_commons | CC BY 2.0

OpenAI опубликовала исследование и набор эталонных тестов для оценки того, насколько внутренние рассуждения языковых моделей — цепочки мыслей (chain-of-thought, CoT) — поддаются мониторингу. Работа, получившая название «Monitoring Monitorability», предлагает систематический подход к измерению способности внешних систем контроля выявлять нежелательное поведение модели по её промежуточным рассуждениям.

Исследование показывает, что мониторинг CoT значительно эффективнее, чем анализ только финальных действий или ответов модели. При этом авторы отмечают, что наблюдаемость может быть хрупкой: она зависит от процедур обучения, источников данных и масштабирования. Предложенный фреймворк призван стандартизировать измерение этого свойства.

Три архетипа тестов и набор из 13 оценок

Фреймворк OpenAI включает 13 отдельных тестов, охватывающих 24 среды. Они организованы в три архетипа, каждый из которых использует разный механизм для измерения наблюдаемости:

Тесты вмешательства (intervention) — проверяют, можно ли выявить и прервать проблемные паттерны рассуждений. Тесты процесса (process) — оценивают, отражают ли цепочки мыслей подлинные рассуждения, а не постфактумные объяснения. Тесты свойства результата (outcome-property) — определяют, коррелирует ли более высокая наблюдаемость с более безопасными и качественными результатами.

Внутри этих архетипов тесты разделены на группы: нейтральные (обычные задачи без нежелательного поведения), сикофантия (склонность модели угождать пользователю), предвзятости (гендерные, расовые и другие) и общее несоответствие (обман, читерство, искажение результатов). По данным OpenAI, большинство современных frontier-моделей показывают высокую, хотя и не идеальную, наблюдаемость в этих тестах.

Масштабирование не ухудшает наблюдаемость

Один из ключевых выводов исследования касается влияния обучения с подкреплением (RL) на наблюдаемость. Авторы сообщают, что RL-оптимизация на текущем масштабе frontier-моделей не приводит к значимому ухудшению способности отслеживать рассуждения. Это важный результат, поскольку ранее существовали опасения, что усиленная оптимизация может сделать цепочки мыслей менее информативными или намеренно запутанными.

Наблюдаемость улучшается с увеличением длины рассуждений: модели, которые «думают» дольше (используют больше тестовых вычислений), как правило, более наблюдаемы. Исследователи также обнаружили интересный компромисс: если модель работает с низким уровнем рассуждений, её можно заменить меньшей моделью, но с более высоким уровнем рассуждений, сохранив сопоставимые возможности и получив лучшую наблюдаемость. Это сопряжено с увеличением вычислительных затрат на инференс — авторы называют это «налогом на наблюдаемость».

Открытые наборы данных и практическое применение

OpenAI не только публикует результаты, но и открывает исходный код и наборы данных для сообщества. Репозиторий на GitHub (github.com/openai/monitorability-evals) содержит код для вычисления метрики наблюдаемости (g-mean²) и симулятор для запуска оценок. Некоторые тесты, основанные на приватных или ограниченных данных, не вошли в открытый релиз.

Компания уже использует мониторинг CoT для обнаружения ревард-хакинга и других форм нежелательного поведения в frontier-моделях и внутренних агентных развертываниях. OpenAI заявляет, что будет включать результаты тестов наблюдаемости в системные карты будущих моделей. Для уже выпущенных моделей — GPT-5.4 thinking, GPT-5.2 thinking, GPT-5 thinking и o3 — компания опубликовала ретроспективные результаты.

Что это меняет для разработчиков и пользователей

Для инженеров, работающих с агентными системами, появление стандартизированных тестов наблюдаемости означает возможность более системной оценки безопасности развертываемых моделей. Вместо ad-hoc проверок выходных данных появляется методология, позволяющая сравнивать разные модели по единой шкале.

Практический вывод: при выборе модели для задач, где критичен контроль над процессом принятия решений (автономные агенты, финансовые операции, медицинские рекомендации), стоит обращать внимание не только на финальные метрики качества, но и на результаты тестов наблюдаемости. Если бюджет инференса позволяет, можно рассмотреть замену одной большой модели на комбинацию меньшей модели с более длинными рассуждениями — это может дать лучший контроль при сопоставимых возможностях.

Также стоит учитывать, что слабый монитор (меньшая модель-контролер) может эффективно отслеживать более сильную модель, если имеет доступ к её CoT. OpenAI показывает, что масштабирование тестовых вычислений монитора улучшает его способность выявлять проблемы, особенно при наличии цепочек рассуждений. Для продакшн-систем это означает возможность использовать менее ресурсоемкие модели для контроля более мощных.

Ограничения и нерешенные вопросы

Несмотря на обнадеживающие результаты, исследование оставляет открытые вопросы. На тесте Scruples, оценивающем наблюдаемость сикофантии, модели показали очень низкую наблюдаемость. Это указывает на то, что некоторые типы нежелательного поведения могут быть принципиально сложнее для обнаружения через CoT.

Кроме того, авторы признают, что наблюдаемость может ухудшаться при дальнейшем масштабировании или изменении процедур обучения. Текущие результаты справедливы для современных frontier-моделей, но не гарантируют сохранения наблюдаемости в будущем. OpenAI призывает исследовательское сообщество к совместной работе по сохранению и улучшению этого свойства.

Для практического использования важно помнить: мониторинг CoT — это дополнительный уровень контроля, а не панацея. Компании, внедряющие агентные системы, должны комбинировать его с другими методами безопасности: валидацией выходных данных, ограничением полномочий, аудитом действий и резервными протоколами отключения.

Источники