
OpenAI опубликовала System Card для функции deep research в ChatGPT. 30-страничный документ, выпущенный 25 февраля 2025 года, детально описывает процедуры безопасности, проведённые до и после релиза: внешний red teaming, оценку frontier-рисков в соответствии с Preparedness Framework, а также mitigations, внедрённые для ключевых категорий угроз. Это первый публичный отчёт такого уровня для функции, которая позволяет ChatGPT выполнять многошаговые исследовательские задачи с использованием браузера и инструментов.
Что содержится в System Card
Документ структурирован вокруг Preparedness Framework — внутренней методологии OpenAI для оценки и мониторинга рисков на границе возможностей моделей. Для deep research команда рассмотрела четыре категории: убеждение (persuasion), кибербезопасность (cybersecurity), автономное реплицирование и адаптацию (autonomous replication and adaptation, ARA), а также биологические угрозы (CBRN).
В каждой категории проводилось тестирование на специализированных наборах задач. Например, для оценки способности модели к убеждению использовались сценарии, в которых deep research должен был составить персонализированное письмо, аргументировать позицию или подобрать риторику для конкретной аудитории. Результаты сравнивались с базовыми моделями GPT-4o и o3.
Результаты по Preparedness Framework, по заявлению OpenAI, не выявили критических превышений порогов. Однако авторы отчёта подчёркивают, что deep research — это не отдельная модель, а система, объединяющая несколько компонентов: браузерный агент на базе o3, модуль планирования, инструменты для работы с кодом и файлами. Именно системный уровень, по мнению разработчиков, требует особого внимания к безопасности.
Внешний red teaming и выявленные риски
В подготовке System Card участвовала группа внешних специалистов по безопасности — red teamers из академических кругов, частных компаний и независимые исследователи. Они тестировали deep research на предмет «джейлбрейков», обхода ограничений, использования в дезинформационных кампаниях, а также на способность модели манипулировать результатами поиска.
Один из ключевых выводов: deep research может быть использована для массового сбора информации о конкретных людях или организациях с целью последующей манипуляции. При этом стандартные текстовые фильтры, работающие в обычном чате, не всегда срабатывают, когда запрос обёрнут в многошаговый исследовательский сценарий.
Дополнительно тестировалась способность модели интерпретировать инструкции, замаскированные в веб-контенте — например, скрытые команды на сайте, который deep research посещает в ходе исследования. Такие атаки (indirect prompt injection) были признаны реалистичной угрозой, и в отчёте описаны конкретные mitigation-стратегии: изоляция выполнения инструментов, проверка выходных данных на соответствие системной инструкции и ограничение на количество шагов.
Mitigations и ограничения
OpenAI внедрила несколько уровней защиты. Во-первых, deep research работает в изолированном браузерном окружении, которое не имеет доступа к внутренним системам OpenAI. Во-вторых, все сгенерированные отчёты проходят пост-обработку: модель повторно проверяет факты, указанные в ответе, и предупреждает пользователя, если какой-либо источник не был найден или выглядит недостоверным.
В-третьих, введены ограничения на количество одновременных сессий deep research для одного аккаунта, а также на объём данных, который может быть скачан за один сеанс. Это сделано для предотвращения автоматизированного скрапинга и злоупотреблений.
Однако System Card не описывает всех деталей. Например, не раскрыты точные пороги для каждого уровня Preparedness Framework — только общие категории. Также не указано, какие именно модели использовались в качестве базовых для сравнения, кроме упоминания GPT-4o и o3.
Что это значит для пользователей и разработчиков
Для тех, кто использует deep research в работе, System Card — это не просто документ, а практическое руководство по ограничениям инструмента. На основе отчёта можно выделить несколько конкретных выводов:
- Проверяйте источники. deep research способна генерировать отчёты с цитатами, но модель может ссылаться на несуществующие страницы или неправильно интерпретировать контент. Пост-процессинг снижает, но не устраняет эту проблему.
- Не доверяйте конфиденциальные данные. Инструмент работает в изолированном окружении, но OpenAI сохраняет логи для анализа безопасности. Если задача требует обработки персональных данных или коммерческой тайны, лучше использовать локальные решения.
- Учитывайте риск prompt injection. Если deep research получает задание, включающее посещение внешних сайтов, содержимое этих сайтов может влиять на поведение модели. Для критически важных исследований стоит минимизировать количество внешних переходов.
Ограничения документа и что осталось за кадром
System Card — это отчёт о безопасности, а не полная техническая спецификация. В нём нет информации о том, как именно deep research обрабатывает конфликтующие источники, какова точность фактчекинга в разных доменах, и какие именно метрики использовались для оценки производительности.
Кроме того, документ был опубликован 25 февраля 2025 года, и с тех пор функциональность deep research могла измениться. OpenAI обещает регулярно обновлять System Card, но на момент публикации это единственная версия.
Независимые исследователи из Berkeley и других университетов ранее указывали на уязвимости в бенчмарках для AI-агентов — некоторые тесты можно «взломать», не решая поставленных задач. OpenAI в своём отчёте не комментирует эту проблему напрямую, но описывает меры, которые должны предотвратить подобные атаки на deep research.
Практический чек-лист для работы с deep research
На основе System Card можно составить простой набор действий для безопасного использования:
Перед запуском исследования убедитесь, что задача не требует доступа к конфиденциальным данным.
2. Ограничьте количество шагов, если задача простая — это снижает риск накопления ошибок.
3. После получения отчёта проверьте первые три ссылки вручную: если они не ведут на указанные страницы, скорее всего, модель сгенерировала правдоподобный, но неточный ответ.
4. Если deep research ссылается на PDF или платный контент, отнеситесь к таким ссылкам с особой осторожностью — модель могла «угадать» название документа.
System Card от OpenAI — это шаг в сторону большей прозрачности для сложных AI-систем. Документ не идеален и оставляет много вопросов, но он даёт практическую основу для оценки рисков при использовании deep research.
