23 января 2025 года OpenAI представила Operator — исследовательский предпросмотр агента, который работает в собственном удалённом браузере и может сам нажимать кнопки, печатать, скроллить и заполнять формы. Техническая основа продукта — модель Computer-Using Agent (CUA), сочетающая зрение GPT-4o и дообучение через reinforcement learning. Это важно не потому, что «чат научился кликать», а потому, что OpenAI предложила универсальный способ автоматизации сайтов без специальных API-интеграций.
Есть и историческая оговорка. 17 июля 2025 года OpenAI объявила, что ключевые возможности Operator встроены в ChatGPT agent, а отдельный сайт operator.chatgpt.com будет выведен из эксплуатации. Поэтому ниже мы разбираем именно Operator образца января 2025 года и отдельно отмечаем, что из этой линии выросло позже.
Коротко
- Operator был не просто «браузером для LLM», а демонстрацией универсального интерфейса: скриншот экрана на входе, мышь и клавиатура на выходе.
- CUA обучали в два этапа: сначала базовое восприятие GUI и управление вводом, затем более высокоуровневые навыки через reinforcement learning — планирование, самокоррекцию и адаптацию к неожиданностям.
- На запуске OpenAI заявила SOTA на WebArena и WebVoyager, а также 38.1% на OSWorld; но сами eval-ы шли в специальных условиях, о чём OpenAI отдельно пишет в companion PDF.
- Безопасность строилась вокруг подтверждений пользователя, takeover mode, watch mode, отказов для чувствительных задач и отдельного монитора промпт-инъекций.
- Главный вывод для практиков: универсальность браузерного агента покупается ценой хрупкости — OCR-ошибок, проблем на сложных интерфейсах и постоянной необходимости держать человека в контуре.
Контекст
До Operator большинство «агентов» в проде делились на два класса. Первый — API-ориентированные системы: они надёжнее, но работают только там, где есть интеграция. Второй — браузерная автоматизация по правилам или скриптам: она полезна, но плохо переносится между сайтами и быстро ломается на нестандартных интерфейсах. Operator пытается закрыть именно этот разрыв.
Идея CUA проста: вместо того чтобы требовать от мира удобные machine-friendly интерфейсы, модель использует те же интерфейсы, что и человек. Она видит пиксели, понимает структуру страницы по скриншоту и выполняет действия через мышь и клавиатуру. В материалах OpenAI это прямо подаётся как способ дотянуться до «длинного хвоста» цифровых задач, которые не покрыты специальными инструментами и API.
Для оценки этой идеи OpenAI опиралась на три уже существующих бенчмарка. WebArena моделирует реалистичные веб-задачи на self-hosted сайтах из доменов вроде e-commerce, форумов, CMS и collaborative software development. WebVoyager проверяет end-to-end навигацию на живых сайтах. OSWorld переносит задачу шире: это уже не только веб, а работа в реальном компьютерном окружении.
Метод
Что такое CUA
По описанию OpenAI, CUA объединяет визуальные возможности GPT-4o с «продвинутым reasoning через reinforcement learning». В system card уточняется, что обучение шло в два слоя: supervised learning давал базовое восприятие экранов и точное управление вводом, а reinforcement learning добавлял более сложные навыки — рассуждение по шагам, исправление ошибок и адаптацию к новым ситуациям.
Практически это означает следующее: модель не получает структурированное DOM-представление сайта как основной интерфейс и не опирается на site-specific API. Она работает через универсальный канал, понятный любому человеку: картинка экрана, курсор, клавиатура, история предыдущих шагов.
Цикл работы
OpenAI описывает цикл CUA как повторяющуюся петлю из трёх стадий.
- Восприятие. Скриншот браузера добавляется в контекст как снимок текущего состояния.
- Рассуждение. Модель выбирает следующий шаг, учитывая текущий экран, историю действий и промежуточную цель.
- Действие. Выполняется клик, ввод текста, прокрутка или другое действие мышью и клавиатурой.
Если задача идёт не по плану, модель может пробовать самокоррекцию. Если упирается в чувствительный шаг или неопределённость, управление возвращается пользователю.
Где человек остаётся в контуре
Это принципиальный момент. Уже в январском релизе Operator не был «полностью автономным» в бытовом смысле. OpenAI пишет, что агент просит пользователя взять управление на себя для логина, ввода платёжных данных и прохождения CAPTCHA. Перед значимыми действиями вроде отправки письма или оформления заказа он должен отдельно запросить подтверждение.
Для особо чувствительных сайтов вводился watch mode: пользователь наблюдает за действиями агента вживую и может остановить ошибочный шаг. Для высокорисковых задач — например, банковских операций или решений с высокой ставкой — продукт должен был отказывать.
Результаты
На запуске OpenAI утверждала, что CUA показывает новый SOTA на WebArena и WebVoyager. Точные числа для WebArena и WebVoyager в наших источниках подробно приведены в research-материале о CUA; поэтому ниже их стоит читать именно как лабораторные результаты, сообщённые самой OpenAI, а не как независимо воспроизведённые внешней стороной.
| Бенчмарк | Что измеряет | Что заявила OpenAI на запуске | Что важно помнить |
|---|---|---|---|
| OSWorld | Работа в реальном компьютерном окружении, не только в вебе | 38.1% успешности для full computer use tasks | Эта цифра повторяется и в CUA release, и в Operator System Card; сама OpenAI отдельно рекомендует human oversight для OS-задач |
| WebArena | Длинные веб-задачи на self-hosted сайтах | Новый SOTA; по данным OpenAI — 58.1% | Companion PDF пишет, что eval шёл в operator browser, а для WebArena использовались подсказки по конкретным сайтам |
| WebVoyager | End-to-end навигация на живых сайтах | Новый SOTA; по данным OpenAI — 87.0% | Это тоже число из собственного research-материала OpenAI; бенчмарк содержит много сравнительно простых веб-задач, что OpenAI сама оговаривает |
Самая полезная для практиков часть — не числа сами по себе, а условия измерения. В отдельном PDF OpenAI указывает, что WebArena и WebVoyager запускались не в стандартных playwright-браузерах, а в operator browser, потому что модель зависит от визуального action space. Для OSWorld использовалась Ubuntu VM авторов бенчмарка, но с доком справа вместо левой стороны экрана; OpenAI прямо пишет, что это слегка улучшало результат. Для WebArena также применялись website-specific prompts, которые помогали модели понять особенности конкретных сайтов и ожидаемый формат ответа.
Иначе говоря, результаты нельзя читать как «чистую» универсальную способность любого браузерного агента с нуля. Это numbers under harness: они характеризуют связку модели, браузерного окружения, промптов и оценочного контура, собранную самой OpenAI.
Интерпретация
Наш комментарий
Главное новшество Operator — не отдельный benchmark score, а смена уровня абстракции. OpenAI фактически говорит: если сайт создан для человека, агент тоже должен уметь работать как человек, а не ждать специальный API. Для разработчика это очень сильная идея, потому что она расширяет зону автоматизации далеко за пределы «идеально интегрированных» сервисов.
Но у такой универсальности есть цена. Когда агент видит мир через пиксели и действует курсором, он наследует почти все человеческие и сверхчеловеческие слабости GUI-автоматизации сразу: случайные поп-апы, нестабильные верстки, плохо читаемый текст, двусмысленные кнопки, неожиданные редиректы и промпт-инъекции в самом контенте страницы. Поэтому Operator оказался важен не как доказательство готовой автономии, а как ранняя рабочая версия новой архитектуры агентности.
То, что уже 17 июля 2025 года OpenAI встроила «ядро» Operator в ChatGPT agent, тоже показательно. Похоже, компания пришла к выводу, что браузерный агент сам по себе — слишком узкий продукт. Гораздо полезнее делать единый агентный стек, где визуальный браузер — только один инструмент рядом с текстовым браузером, терминалом и коннекторами к внешним данным.
Ограничения и критика
Во-первых, визуальный интерфейс делает систему хрупкой на текстах, которые неудобно читать с экрана. В Operator System Card OpenAI отдельно описывает OCR-проблемы на случайных строках, API-ключах, адресах кошельков и длинных последовательностях символов. Это важное ограничение: агент может быть неплох в бытовой навигации, но слаб там, где цена ошибки в одном символе слишком высока.
Во-вторых, даже сама OpenAI в product post пишет, что ранний Operator испытывал трудности со сложными интерфейсами вроде создания слайдов и работы с календарями. Это хороший антидот против завышенных ожиданий: наличие мыши и клавиатуры ещё не означает надёжной работы на любой GUI-задаче.
В-третьих, проблема prompt injection никуда не делась. В system card OpenAI описывает многоуровневую защиту: instruction hierarchy в более широком семействе работ OpenAI, подтверждения пользователя, отказы для рискованных задач, отдельный монитор экрана и пайплайн быстрого обновления защит. Но там же компания прямо пишет, что prompt injections остаются областью постоянного риска. Для практиков это означает простое правило: чем шире права у агента и чем более чувствительные данные он видит, тем дороже обходится любая удачная инъекция.
В-четвёртых, published evals по безопасности и полезности в основном описаны самой OpenAI. Это не делает их бесполезными, но требует аккуратной интерпретации. По состоянию на запуск Operator базовая картина была такой: лаборатория показала рабочую систему, подробно описала собственные риски и оговорки, но не представила независимый внешний аудит, который можно было бы считать окончательным доказательством надёжности.
В-пятых, сам способ измерения тоже важен. Website-specific prompts, нестандартное окружение и product-specific browser harness помогают реальному продукту — и это нормально. Но из этого не следует, что любой «агент в браузере» автоматически получит те же результаты, если просто дать модели скриншоты и действия мышью.
Вывод
Operator был важен как демонстрация универсального компьютерного интерфейса для ИИ: не через специальные интеграции, а через тот же GUI, которым пользуется человек. В январе 2025 года OpenAI показала, что такой подход уже может решать часть реальных веб-задач и даже выглядеть убедительно на профильных бенчмарках.
Но тот же запуск сразу показал и пределы подхода: визуальная хрупкость, неустойчивость на сложных интерфейсах, уязвимость к prompt injection и постоянная потребность в пользовательском контроле. Поэтому Operator разумнее понимать не как готового «цифрового сотрудника», а как ранний, но важный строительный блок для более широких агентных систем, в которые OpenAI и встроила его летом 2025 года.
Источники
- Introducing Operator — OpenAI
- Computer-Using Agent — OpenAI
- Operator System Card — OpenAI
- CUA eval extra information — OpenAI
- WebArena: A Realistic Web Environment for Building Autonomous Agents
- WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
- Introducing ChatGPT agent: bridging research and action — OpenAI
- ChatGPT agent – release notes — OpenAI Help Center
- The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions — OpenAI
FAQ
Чем Operator отличался от обычного LLM с браузингом?
Тем, что он не только читал страницы, но и действовал в удалённом браузере через визуальный интерфейс: кликал, печатал, скроллил и возвращал управление пользователю на чувствительных шагах.
Почему OpenAI не ограничилась API-интеграциями?
Потому что API покрывают только часть цифрового мира. CUA задуман как универсальный слой для сайтов и интерфейсов, которые уже сделаны для людей, но не имеют удобного программного доступа.
Можно ли считать benchmark-результаты доказательством продовой надёжности?
Нет. Они полезны как сигнал исследовательского прогресса, но их нужно читать вместе с условиями eval-а: типом браузера, подсказками, окружением и описанными ограничениями безопасности.
Что стало с Operator позже?
17 июля 2025 года OpenAI объявила, что ключевые функции Operator встроены в ChatGPT agent. То есть линия развития не исчезла, а стала частью более широкого агентного продукта.
