OpenAI описала меры безопасности браузерного агента Operator

В Operator System Card OpenAI описала защиту браузерного агента от промпт-инъекций, джейлбрейков и рисков для приватности. Компания также рассказала о внешнем красном тестировании и ограничениях опубликованных оценок.

Operator System Card OpenAI с описанием мер безопасности браузерного ИИ-агента
Operator System Card OpenAI с описанием мер безопасности браузерного ИИ-агента
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

OpenAI опубликовала Operator System Card — документ о безопасности браузерного ИИ-агента Operator. Материал датирован 23 января 2025 года и описывает защитные меры на уровне модели и продукта, а также подход компании к тестированию системы.

Operator относится к классу агентов, которые работают не только с текстом, но и с веб-интерфейсами. Такая система может анализировать содержимое страниц, переходить по ссылкам, заполнять формы и выполнять последовательность действий по поручению пользователя. Поэтому ошибка агента способна привести к изменению настроек, отправке данных или другому практическому результату.

OpenAI представляет документ как часть более широкой системы оценки безопасности. При этом Operator System Card остаётся материалом самой компании: он описывает заявленные меры и результаты проведённых проверок, но не заменяет независимый аудит.

Почему для Operator нужны отдельные меры защиты

Обычная языковая модель в основном формирует ответ на запрос. Браузерный агент получает доступ к внешнему содержимому и может использовать его в процессе выполнения задачи. Инструкция, найденная на сайте или в загруженном документе, может оказаться вредоносной либо противоречить намерению пользователя.

Один из ключевых сценариев риска — промпт-инъекция. В этом случае злоумышленник пытается разместить на странице текст, который агент ошибочно принимает за команду. Такая атака может быть направлена на изменение последовательности действий, раскрытие информации или переход к нежелательному сценарию.

Отдельно OpenAI рассматривает джейлбрейки — попытки обойти ограничения модели или продукта. Для браузерного агента последствием может стать не только неподходящий текстовый ответ. Если защитные механизмы не сработают, система может попытаться выполнить действие с внешним сервисом или использовать данные пользователя способом, которого тот не ожидал.

Вопрос приватности возникает из-за самого характера работы агента. Во время сессии он может сталкиваться с аккаунтами, формами, перепиской и другими сведениями, доступными в браузере. Наличие технического доступа к информации не означает, что агенту следует автоматически использовать её или передавать третьим сторонам.

Как OpenAI описывает многоуровневую защиту

В Operator System Card безопасность рассматривается как сочетание ограничений модели и механизмов продукта. OpenAI не сводит защиту к одному фильтру или отдельному правилу: предполагается несколько уровней контроля, которые должны дополнять друг друга.

Такой подход важен для агентов, работающих с вебом. Даже если модель неверно интерпретирует текст на странице, продуктовые ограничения могут остановить дальнейшее действие. Одновременно интерфейсные проверки не устраняют необходимость тестировать саму модель на устойчивость к манипуляциям.

Для пользователя это означает, что способность агента выполнить задачу не равна гарантии безопасного результата. Просмотр страницы или подготовка информации обычно создают меньше риска, чем отправка формы, изменение настроек аккаунта, публикация сообщения или оформление заказа.

Особое значение имеют операции, которые сложно отменить. Перед их выполнением пользователю стоит проверить, какие данные доступны агенту, какое именно действие он собирается совершить и предусмотрен ли способ отмены. Это относится к любым системам, которые получают доступ к браузеру, а не только к Operator.

Контекст запуска продукта OpenAI описывала в отдельном материале о Operator: https://openai.com/index/introducing-operator/. Эти сведения помогают отличать возможности агента от мер, изложенных непосредственно в карте безопасности.

Внешнее красное тестирование и оценки

OpenAI сообщает, что при разработке защит использовала внешнее красное тестирование. В таком формате специалисты целенаправленно ищут слабые места и пытаются добиться нежелательного поведения системы.

Для браузерного агента подобные проверки должны учитывать цепочки действий, а не только отдельные запросы. Потенциальная атака может начинаться с содержимого веб-страницы, продолжаться переходом на другой ресурс и завершаться попыткой передать данные через форму. Оценка одного шага не показывает, как система поведёт себя во всей последовательности.

В документе также упоминаются оценки безопасности и продолжающаяся работа над защитами. Однако из краткого публичного описания нельзя определить эффективность каждой меры. Для независимого сравнения понадобились бы подробные сведения о тестовых наборах, критериях успешной атаки, количестве проверок и результатах до и после внедрения механизмов защиты.

Поэтому опубликованный материал не даёт оснований утверждать, что Operator защищён от всех промпт-инъекций или джейлбрейков. Корректнее говорить о заявленном OpenAI многоуровневом подходе и проведённых проверках, масштаб которых должен оцениваться по полному тексту документа.

Общие принципы OpenAI в области безопасности опубликованы на странице компании: https://openai.com/safety/. Это более широкий контекст, а не независимая проверка Operator.

Что это меняет для пользователей и разработчиков

Для разработчиков Operator System Card подчёркивает необходимость разделять возможности модели и полномочия продукта. Агент должен не только понимать инструкции, но и работать в рамках ограниченного доступа к данным и действиям. Опасные операции требуют дополнительных проверок и возможности вмешательства пользователя.

При тестировании собственных ИИ-агентов стоит отдельно проверять:

  • инструкции, спрятанные в тексте веб-страницы или загруженного документа;
  • попытки заставить агента раскрыть системные правила или данные пользователя;
  • переходы на сторонние сайты и отправку информации через формы;
  • цепочки действий, в которых несколько безопасных шагов приводят к рискованному результату;
  • поведение системы после ошибки, прерывания сессии или изменения содержимого страницы.

Пользователям полезно разделять информационные и исполнительские задачи. Сводка статьи или поиск нужной страницы обычно менее рискованны, чем изменение профиля, отправка письма, публикация текста или покупка. Перед подтверждением следует проверить итоговые данные и адрес сайта, на котором агент собирается выполнить действие.

Operator System Card фиксирует состояние подхода OpenAI на момент публикации. Она помогает понять, какие угрозы компания считает ключевыми для браузерных агентов, но сама по себе не доказывает отсутствие уязвимостей. При оценке подобных продуктов нужно отдельно смотреть на доступные разрешения, запросы подтверждения, обработку персональных данных и возможность отменить результат действия.

Источники