Запись архива

Computer Use от Anthropic: как Claude 3.5 Sonnet управляет экраном

Разбираем запуск Computer Use от Anthropic 22 октября 2024 года: как Claude 3.5 Sonnet работает со скриншотами, почему упирается в пиксели и что реально показал OSWorld.

Схема цикла Computer Use: инструкция пользователя, скриншот экрана, выбор действия Claude, исполнение в контейнере, новый скриншот и повтор agent loop

22 октября 2024 года Anthropic представила публичную бета-версию Computer Use вместе с обновлённым Claude 3.5 Sonnet. Идея была не в новом узком API для одной задачи, а в том, чтобы модель видела скриншот, решала, куда нажать, и просила приложение выполнить действие мышью или клавиатурой. Это важно, потому что такой подход обещает автоматизацию там, где нет готовой интеграции, но одновременно переносит в модель все слабые места графических интерфейсов: медлительность, неоднозначность и уязвимость к prompt injection.

Ниже — разбор именно запуска от 22 октября 2024 года и связанных с ним материалов Anthropic. Где это полезно для практики, я отдельно отмечаю, что относится уже к более поздней документации Anthropic по состоянию на август 2026 года, чтобы не смешивать исторический релиз и текущую реализацию.

Коротко

  • Computer Use в запуске Anthropic — это связка из скриншотов, команд мыши и клавиатуры и агентного цикла, а не «магия внутри браузера».
  • Anthropic сообщила о 14.9% на OSWorld в режиме screenshot-only и о 22.0%, если дать модели больше шагов; человеческий ориентир в OSWorld — 72.36%.
  • Ключевая техническая проблема — GUI grounding: модель должна понять, что именно видно на экране, и точно перевести это в координаты и действия.
  • Главная практическая ценность — автоматизация поверх обычного ПО без отдельного API. Главный риск — prompt injection и ошибки на длинных цепочках действий.
  • Для чувствительных сценариев Anthropic с самого начала советовала песочницу, ограниченные привилегии и подтверждение человеком значимых действий.

Контекст: какую проблему решал Computer Use

До Computer Use агентные системы обычно строились так: для модели заранее делали набор специальных инструментов, а затем учили выбирать правильный вызов. Это удобно, когда у сервиса есть API и разработчик контролирует окружение. Но большая часть реальной офисной и операционной работы устроена иначе: сайты, внутренние панели, десктопные приложения, формы, кнопки, переключатели, всплывающие окна.

Anthropic в исследовательской заметке прямо противопоставляет два подхода: раньше разработчики подгоняли инструменты под модель, а здесь попытались подогнать модель под уже существующие человеческие интерфейсы. В этом и состоит главный сдвиг: вместо нового протокола для каждого сервиса модель учится работать через экран.

Сложность задачи хорошо видна по бенчмарку OSWorld. Авторы OSWorld описывают 369 реальных компьютерных задач с вебом, десктопными приложениями, файловыми операциями и многошаговыми workflow; человеческий результат в их работе — 72.36%. Anthropic использовала именно OSWorld как внешний ориентир для оценки новой способности Claude. Это важный выбор: речь шла не о демо на одном сайте, а о попытке измерить общую пригодность модели к работе с обычным компьютером.

Метод: что Anthropic на самом деле построила

В октябрьском запуске 2024 года Computer Use описывался просто: модель получает инструкцию пользователя, «видит» экран через скриншот, а затем выдаёт команды вроде перемещения курсора, клика или ввода текста. В более поздней документации Anthropic это уже оформлено как явный agent loop: приложение отправляет промпт и список инструментов, Claude выбирает инструмент, внешний код исполняет действие в контейнере или виртуальной машине, возвращает результат, и цикл повторяется до завершения задачи.

Ключевой момент для практиков: Claude не нажимает кнопки сам по себе. По актуальной документации Anthropic Computer Use — клиентский инструмент: именно ваше приложение должно сделать скриншот, выполнить клик, отправить нажатие клавиш, а затем вернуть модели результат. То есть Computer Use — это не «удалённый рабочий стол от Anthropic», а интерфейс между моделью и вашим изолированным окружением.

Исследовательская заметка Anthropic даёт редкую деталь о самом навыке. Авторы пишут, что модель пришлось учить не только интерпретировать экран, но и считать пиксели, чтобы понять, насколько по вертикали и горизонтали нужно сдвинуть курсор для правильного клика. Это важное уточнение: навигация по GUI здесь упирается не столько в общий интеллект, сколько в точное заземление действия в визуальном пространстве.

Из этого вытекает и архитектурное ограничение запуска 2024 года. Claude работал не с видеопотоком, а с последовательностью снимков экрана. Anthropic сама описывает это как «flipbook»-режим: модель видит набор кадров и собирает происходящее по ним, а не наблюдает непрерывный поток. Поэтому короткоживущие уведомления, анимации, быстрые изменения фокуса и мелкие элементы интерфейса становятся естественным источником ошибок.

По состоянию на запуск 2024 года Anthropic подчёркивала, что некоторые обычные для человека действия — прокрутка, drag-and-drop, масштабирование — ещё даются плохо. Это важная историческая деталь. Если читать только актуальные документы 2026 года, можно решить, что инструмент изначально был богаче: там уже перечислены и дополнительные действия, и более проработанные рекомендации по обработке координат и масштабированию. Но для честного разбора нужно разделять две вещи: что было заявлено на старте и как интерфейс дозрел позже.

Для разработчика из этого следует практический вывод: Computer Use — это не единая «модель, которая умеет всё на экране», а комбинация из нескольких хрупких частей. Нужны корректные размеры изображения, точное соответствие между скриншотом и координатами, предсказуемое окружение, ограниченный набор приложений и дисциплина в построении цикла запросов.

Результаты: что показал запуск

Главный внешний результат, который Anthropic вынесла в анонс и модельную карточку, — оценка на OSWorld. Ниже — только те числа, которые прямо подтверждаются как минимум двумя источниками.

Метрика Значение Что именно измерялось Комментарий
OSWorld, screenshot-only 14.9% Результат обновлённого Claude 3.5 Sonnet в настройке Anthropic на запуске Базовый публичный ориентир релиза 22 октября 2024 года
OSWorld, screenshot-only, больше шагов 22.0% Та же способность, но с увеличенным числом допустимых взаимодействий Дополнительный бюджет шагов заметно помогает, но не закрывает разрыв с человеком
OSWorld, человеческий ориентир 72.36% Человеческий результат из материалов OSWorld Показывает, насколько далеко релиз 2024 года был от устойчивой «человеческой» работы за компьютером
Размер OSWorld 369 задач Реальные задачи с вебом, десктопом, файлами и workflow Важно, потому что речь идёт не о наборе игрушечных кликов, а о широком наборе сценариев

Самое интересное здесь — не абсолютный балл, а структура сигнала. Если увеличение числа шагов поднимает результат с 14.9% до 22.0%, значит часть провалов связана не только с «неувидел кнопку», но и с длинной последовательностью действий: модель ошибается, исправляется, тратит попытки, возвращается назад. Иными словами, проблема лежит одновременно в зрительном распознавании, планировании и устойчивости агентного цикла.

Важно для корректности сравнения: OSWorld как бенчмарк существовал и до релиза Anthropic, а в исходной статье OSWorld авторы показывали другой исторический срез моделей и другой экспериментальный контекст. Поэтому прямое сравнение «14.9 против всего рынка» нужно читать осторожно. Надёжный вывод здесь скромнее: Anthropic показала, что screenshot-only управление экраном уже можно мерить на серьёзном внешнем бенчмарке, но в октябре 2024 года это всё ещё была ранняя и далёкая от человеческой надёжности способность.

Интерпретация

Наш комментарий

Главная новизна Computer Use — не в том, что Claude внезапно получил принципиально новый вид рассуждения. Скорее Anthropic добавила модели универсальный слой взаимодействия с существующим программным миром. Это очень практичный ход: вместо того чтобы ждать API от каждого продукта, модель может пытаться работать там, где уже есть экран, мышь и клавиатура.

Но цифры запуска показывают и предел этого подхода. Разрыв между 22.0% с увеличенным числом шагов и 72.36% у человека слишком велик, чтобы говорить о зрелой автономной работе. На наш взгляд, это делает релиз 2024 года важным не как замену человеку, а как демонстрацию нового интерфейса между моделью и программами.

Ещё один полезный вывод для инженерной практики: улучшение при большем числе шагов намекает, что компьютерные агенты упираются не только в «сырой интеллект» модели, но и в качество оркестрации. То, как вы строите цикл «скриншот → решение → действие → новый скриншот», как обрезаете контекст, как обрабатываете ошибки и когда просите человека подтвердить шаг, может быть не менее важно, чем выбор самой модели.

Поэтому Computer Use лучше понимать как строительный блок для агентных систем, а не как готового цифрового оператора. В хорошей архитектуре он закрывает «последнюю милю» интерфейса там, где другие инструменты не работают. В плохой архитектуре он превращается в дорогой и медленный способ случайно нажимать кнопки.

Ограничения и критика

Первое ограничение — результат всё ещё низкий относительно человека. Даже расширенный режим с большим числом шагов остаётся далеко от человеческого ориентира OSWorld. Для сценариев, где ошибка дорого стоит, одного факта «модель умеет кликать» недостаточно.

Второе ограничение — хрупкость screenshot-only подхода. Anthropic сама указывает на «flipbook»-природу восприятия: модель работает по последовательности снимков и может пропускать краткие события. Актуальная документация дополняет это очень инженерным замечанием: если размеры скриншота и объявленные размеры дисплея не совпадают, клики начинают систематически промахиваться.

Третье ограничение — prompt injection. И исследовательская заметка, и документация Anthropic предупреждают, что инструкции на веб-страницах или внутри изображений могут конфликтовать с вашим исходным намерением. Поэтому Anthropic советует изоляцию окружения, минимальные привилегии, ограничение доступа к чувствительным аккаунтам и подтверждение человеком действий с реальными последствиями.

Четвёртое ограничение — демонстрационный код не равен production-архитектуре. Официальный quickstart Anthropic прямо предупреждает, что референсная реализация минимальна, слабо разделяет компоненты и рассчитана скорее на обучение и эксперимент, чем на многопользовательскую боевую систему. Это честное и полезное предупреждение: Computer Use нельзя безопасно внедрять, просто «запустив демо».

Пятое ограничение — историческая путаница версий. В документации Anthropic эта волна релиза проходит с суффиксом 20241022, но нынешние документы уже описывают более поздние инструменты, версии и улучшения. Если вы разбираете релиз октября 2024 года, нельзя автоматически переносить на него все возможности, которые появились в API позже.

Вывод

Computer Use от Anthropic в релизе 22 октября 2024 года — это важный шаг к агентам, которые работают не через специально написанные интеграции, а через обычный экран. Технически это означает связку из визуального восприятия, пиксельного заземления, планирования действий и аккуратно построенного внешнего цикла исполнения.

Но материалы самого Anthropic-старта достаточно честны: способность была ранней, медленной и подверженной ошибкам. Практический смысл релиза не в том, что Claude уже «умеет работать за вас за компьютером», а в том, что стало понятно, как вообще может выглядеть этот класс интерфейсов — и какие ограничения придётся решать инженерам, прежде чем он станет надёжным.

Источники

FAQ

Computer Use — это отдельная модель?

Нет. В октябре 2024 года Anthropic запускала эту способность вместе с обновлённым Claude 3.5 Sonnet; в документации семейство релиза помечается датой 20241022.

Чем Computer Use отличается от обычного tool use?

Обычный tool use вызывает заранее описанные функции. Computer Use добавляет слой работы с GUI: модель смотрит на скриншот и просит внешний код выполнить клик, ввод текста или нажатие клавиш в изолированном окружении.

Почему результат на OSWorld оказался таким низким?

Потому что задача сложная: нужно распознавать интерфейс, переводить его в координаты, планировать длинную последовательность шагов и устойчиво восстанавливаться после ошибок. Даже увеличение числа шагов помогло лишь частично.

Где Computer Use уместен на практике?

Там, где нет API или он слишком дорог в интеграции: тестирование интерфейсов, сбор данных из старых внутренних систем, рутинные бэк-офисные workflow. Но для чувствительных действий нужен sandbox, журналирование и подтверждение человеком.

Читайте также