Запись архива

OpenAI опубликовала System Card агента ChatGPT: архитектура, безопасность и границы возможностей

OpenAI выпустила технический отчёт о внутреннем устройстве агента ChatGPT — модели, объединяющей исследования, браузерную автоматизацию и выполнение кода. Разбираем ключевые выводы документа и что они значат для разработчиков агентных систем.

Интерфейс агента ChatGPT с инструментами браузера и выполнения кода
Интерфейс агента ChatGPT с инструментами браузера и выполнения кода
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

17 июля 2025 года OpenAI опубликовала System Card агента ChatGPT — технический документ, описывающий архитектуру, возможности и меры безопасности модели, которая объединяет исследовательские способности, браузерную автоматизацию и инструменты выполнения кода. Это первый подобный отчёт, выпущенный в рамках Preparedness Framework, и он даёт представление о том, как компания оценивает риски агентных систем.

Что содержит документ

System Card описывает агентную модель ChatGPT как систему, способную выполнять многошаговые задачи: от сбора информации в интернете до генерации и запуска кода. В документе подробно разбираются сценарии использования, включая автоматизацию работы с электронными таблицами, написание отчётов и взаимодействие с внешними сервисами.

Ключевое отличие агента от стандартного чат-интерфейса — способность удерживать контекст задачи на протяжении нескольких шагов, самостоятельно выбирать инструменты и возвращаться к результату после завершения. OpenAI подчёркивает, что агент не просто отвечает на запросы, а выполняет порученную работу, что приближает его к полноценному ассистенту.

Оценка безопасности по Preparedness Framework

Документ построен вокруг Preparedness Framework — внутренней методологии OpenAI для оценки рисков перед развёртыванием. В System Card агента рассматриваются четыре категории:

— Кибербезопасность: способность модели выполнять атаки или находить уязвимости. Оценки показывают, что агент не достигает критического порога, но способен автоматизировать некоторые этапы атак.

— Биологические угрозы: возможность помочь в создании биологического оружия или проведении опасных экспериментов. Результаты умеренные, но компания сохраняет мониторинг.

— Убеждение и манипуляция: способность модели влиять на поведение пользователя. В документе отмечается, что агент может генерировать убедительные аргументы, но пока не способен к долгосрочной манипуляции.

— Автономность и самосовершенствование: способность модели изменять собственный код или обходить ограничения. OpenAI заявляет, что такие сценарии не были обнаружены в тестах, но система мониторинга остаётся активной.

Важно: System Card описывает оценки, проведённые в офлайн-режиме. Реальное поведение агента в продакшене может отличаться, и компания предупреждает об этом в тексте документа.

Архитектура агента: как это работает

Из описания следует, что агент ChatGPT использует модульную архитектуру: планировщик, исполнитель и набор инструментов. Планировщик разбивает задачу на подзадачи, исполнитель выбирает инструменты (браузер, интерпретатор кода, файловая система), а результаты возвращаются для следующего шага.

OpenAI не раскрывает полную архитектуру, но указывает, что агент построен на базе GPT-5-main и GPT-5-thinking — моделей, описанных в более ранних system cards. Это означает, что агент использует как быструю генерацию ответов, так и глубокое рассуждение в зависимости от сложности задачи.

Практические наблюдения и ограничения

Реакция сообщества, в частности на Hacker News, показывает, что пользователи отмечают типичные проблемы агентных систем: ошибки в 2-5% данных, которые сложно обнаружить без полной проверки, и необходимость ручной верификации результатов.

Один из комментаторов на Hacker News под ником twalkz заметил: «Идея того, что AI сделает 98% работы, а человек проверит 2%, часто приводит к тому, что именно эти 2% ошибок оказываются критическими и требуют больше времени на поиск, чем полная ручная работа».

Это важное замечание: для разработчиков, внедряющих агентные системы, ключевым становится не столько процент автоматизации, сколько создание механизмов верификации и отката. Агент ChatGPT — мощный инструмент, но он не заменяет контроль качества.

Что это значит для разработчиков и исследователей

System Card агента ChatGPT — не просто маркетинговый документ. Это технический отчёт, который задаёт стандарт прозрачности для агентных систем. Для тех, кто строит собственных агентов, документ полезен как пример оценки рисков: какие сценарии тестировать, какие пороги безопасности устанавливать и как документировать поведение модели.

Одновременно с System Card OpenAI продолжает развивать Agents SDK — лёгкий набор инструментов для создания агентов на Python. SDK позволяет строить многоагентные системы с передачей контекста, а также включает встроенную трассировку для отладки.

Для практического применения важно понимать: агент ChatGPT — это не финальный продукт, а текущая версия, которая будет эволюционировать. System Card фиксирует состояние на июль 2025 года, и последующие обновления могут изменить как возможности, так и меры безопасности.

Ограничения документа и что остаётся за кадром

В System Card не раскрыты детали обучения агента, архитектура планировщика и точные метрики производительности на реальных задачах. Компания ссылается на результаты внутренних тестов, но не публикует полные наборы данных или сценарии. Это стандартная практика для OpenAI, но она ограничивает возможность независимой верификации.

Кроме того, документ не описывает поведение агента в долгосрочных сессиях или при одновременной работе с несколькими пользователями. Эти сценарии могут выявить проблемы, не замеченные в коротких тестах.

Для тех, кто планирует использовать агента ChatGPT в production-среде, стоит провести собственные тесты на репрезентативных задачах, а не полагаться исключительно на заявленные показатели.

Источники