22 октября 2024 года Anthropic представила публичную бета-версию Computer Use вместе с обновлённым Claude 3.5 Sonnet. Идея была не в новом узком API для одной задачи, а в том, чтобы модель видела скриншот, решала, куда нажать, и просила приложение выполнить действие мышью или клавиатурой. Это важно, потому что такой подход обещает автоматизацию там, где нет готовой интеграции, но одновременно переносит в модель все слабые места графических интерфейсов: медлительность, неоднозначность и уязвимость к prompt injection.
Ниже — разбор именно запуска от 22 октября 2024 года и связанных с ним материалов Anthropic. Где это полезно для практики, я отдельно отмечаю, что относится уже к более поздней документации Anthropic по состоянию на август 2026 года, чтобы не смешивать исторический релиз и текущую реализацию.
Коротко
- Computer Use в запуске Anthropic — это связка из скриншотов, команд мыши и клавиатуры и агентного цикла, а не «магия внутри браузера».
- Anthropic сообщила о 14.9% на OSWorld в режиме screenshot-only и о 22.0%, если дать модели больше шагов; человеческий ориентир в OSWorld — 72.36%.
- Ключевая техническая проблема — GUI grounding: модель должна понять, что именно видно на экране, и точно перевести это в координаты и действия.
- Главная практическая ценность — автоматизация поверх обычного ПО без отдельного API. Главный риск — prompt injection и ошибки на длинных цепочках действий.
- Для чувствительных сценариев Anthropic с самого начала советовала песочницу, ограниченные привилегии и подтверждение человеком значимых действий.
Контекст: какую проблему решал Computer Use
До Computer Use агентные системы обычно строились так: для модели заранее делали набор специальных инструментов, а затем учили выбирать правильный вызов. Это удобно, когда у сервиса есть API и разработчик контролирует окружение. Но большая часть реальной офисной и операционной работы устроена иначе: сайты, внутренние панели, десктопные приложения, формы, кнопки, переключатели, всплывающие окна.
Anthropic в исследовательской заметке прямо противопоставляет два подхода: раньше разработчики подгоняли инструменты под модель, а здесь попытались подогнать модель под уже существующие человеческие интерфейсы. В этом и состоит главный сдвиг: вместо нового протокола для каждого сервиса модель учится работать через экран.
Сложность задачи хорошо видна по бенчмарку OSWorld. Авторы OSWorld описывают 369 реальных компьютерных задач с вебом, десктопными приложениями, файловыми операциями и многошаговыми workflow; человеческий результат в их работе — 72.36%. Anthropic использовала именно OSWorld как внешний ориентир для оценки новой способности Claude. Это важный выбор: речь шла не о демо на одном сайте, а о попытке измерить общую пригодность модели к работе с обычным компьютером.
Метод: что Anthropic на самом деле построила
В октябрьском запуске 2024 года Computer Use описывался просто: модель получает инструкцию пользователя, «видит» экран через скриншот, а затем выдаёт команды вроде перемещения курсора, клика или ввода текста. В более поздней документации Anthropic это уже оформлено как явный agent loop: приложение отправляет промпт и список инструментов, Claude выбирает инструмент, внешний код исполняет действие в контейнере или виртуальной машине, возвращает результат, и цикл повторяется до завершения задачи.
Ключевой момент для практиков: Claude не нажимает кнопки сам по себе. По актуальной документации Anthropic Computer Use — клиентский инструмент: именно ваше приложение должно сделать скриншот, выполнить клик, отправить нажатие клавиш, а затем вернуть модели результат. То есть Computer Use — это не «удалённый рабочий стол от Anthropic», а интерфейс между моделью и вашим изолированным окружением.
Исследовательская заметка Anthropic даёт редкую деталь о самом навыке. Авторы пишут, что модель пришлось учить не только интерпретировать экран, но и считать пиксели, чтобы понять, насколько по вертикали и горизонтали нужно сдвинуть курсор для правильного клика. Это важное уточнение: навигация по GUI здесь упирается не столько в общий интеллект, сколько в точное заземление действия в визуальном пространстве.
Из этого вытекает и архитектурное ограничение запуска 2024 года. Claude работал не с видеопотоком, а с последовательностью снимков экрана. Anthropic сама описывает это как «flipbook»-режим: модель видит набор кадров и собирает происходящее по ним, а не наблюдает непрерывный поток. Поэтому короткоживущие уведомления, анимации, быстрые изменения фокуса и мелкие элементы интерфейса становятся естественным источником ошибок.
По состоянию на запуск 2024 года Anthropic подчёркивала, что некоторые обычные для человека действия — прокрутка, drag-and-drop, масштабирование — ещё даются плохо. Это важная историческая деталь. Если читать только актуальные документы 2026 года, можно решить, что инструмент изначально был богаче: там уже перечислены и дополнительные действия, и более проработанные рекомендации по обработке координат и масштабированию. Но для честного разбора нужно разделять две вещи: что было заявлено на старте и как интерфейс дозрел позже.
Для разработчика из этого следует практический вывод: Computer Use — это не единая «модель, которая умеет всё на экране», а комбинация из нескольких хрупких частей. Нужны корректные размеры изображения, точное соответствие между скриншотом и координатами, предсказуемое окружение, ограниченный набор приложений и дисциплина в построении цикла запросов.
Результаты: что показал запуск
Главный внешний результат, который Anthropic вынесла в анонс и модельную карточку, — оценка на OSWorld. Ниже — только те числа, которые прямо подтверждаются как минимум двумя источниками.
| Метрика | Значение | Что именно измерялось | Комментарий |
|---|---|---|---|
| OSWorld, screenshot-only | 14.9% | Результат обновлённого Claude 3.5 Sonnet в настройке Anthropic на запуске | Базовый публичный ориентир релиза 22 октября 2024 года |
| OSWorld, screenshot-only, больше шагов | 22.0% | Та же способность, но с увеличенным числом допустимых взаимодействий | Дополнительный бюджет шагов заметно помогает, но не закрывает разрыв с человеком |
| OSWorld, человеческий ориентир | 72.36% | Человеческий результат из материалов OSWorld | Показывает, насколько далеко релиз 2024 года был от устойчивой «человеческой» работы за компьютером |
| Размер OSWorld | 369 задач | Реальные задачи с вебом, десктопом, файлами и workflow | Важно, потому что речь идёт не о наборе игрушечных кликов, а о широком наборе сценариев |
Самое интересное здесь — не абсолютный балл, а структура сигнала. Если увеличение числа шагов поднимает результат с 14.9% до 22.0%, значит часть провалов связана не только с «неувидел кнопку», но и с длинной последовательностью действий: модель ошибается, исправляется, тратит попытки, возвращается назад. Иными словами, проблема лежит одновременно в зрительном распознавании, планировании и устойчивости агентного цикла.
Важно для корректности сравнения: OSWorld как бенчмарк существовал и до релиза Anthropic, а в исходной статье OSWorld авторы показывали другой исторический срез моделей и другой экспериментальный контекст. Поэтому прямое сравнение «14.9 против всего рынка» нужно читать осторожно. Надёжный вывод здесь скромнее: Anthropic показала, что screenshot-only управление экраном уже можно мерить на серьёзном внешнем бенчмарке, но в октябре 2024 года это всё ещё была ранняя и далёкая от человеческой надёжности способность.
Интерпретация
Наш комментарий
Главная новизна Computer Use — не в том, что Claude внезапно получил принципиально новый вид рассуждения. Скорее Anthropic добавила модели универсальный слой взаимодействия с существующим программным миром. Это очень практичный ход: вместо того чтобы ждать API от каждого продукта, модель может пытаться работать там, где уже есть экран, мышь и клавиатура.
Но цифры запуска показывают и предел этого подхода. Разрыв между 22.0% с увеличенным числом шагов и 72.36% у человека слишком велик, чтобы говорить о зрелой автономной работе. На наш взгляд, это делает релиз 2024 года важным не как замену человеку, а как демонстрацию нового интерфейса между моделью и программами.
Ещё один полезный вывод для инженерной практики: улучшение при большем числе шагов намекает, что компьютерные агенты упираются не только в «сырой интеллект» модели, но и в качество оркестрации. То, как вы строите цикл «скриншот → решение → действие → новый скриншот», как обрезаете контекст, как обрабатываете ошибки и когда просите человека подтвердить шаг, может быть не менее важно, чем выбор самой модели.
Поэтому Computer Use лучше понимать как строительный блок для агентных систем, а не как готового цифрового оператора. В хорошей архитектуре он закрывает «последнюю милю» интерфейса там, где другие инструменты не работают. В плохой архитектуре он превращается в дорогой и медленный способ случайно нажимать кнопки.
Ограничения и критика
Первое ограничение — результат всё ещё низкий относительно человека. Даже расширенный режим с большим числом шагов остаётся далеко от человеческого ориентира OSWorld. Для сценариев, где ошибка дорого стоит, одного факта «модель умеет кликать» недостаточно.
Второе ограничение — хрупкость screenshot-only подхода. Anthropic сама указывает на «flipbook»-природу восприятия: модель работает по последовательности снимков и может пропускать краткие события. Актуальная документация дополняет это очень инженерным замечанием: если размеры скриншота и объявленные размеры дисплея не совпадают, клики начинают систематически промахиваться.
Третье ограничение — prompt injection. И исследовательская заметка, и документация Anthropic предупреждают, что инструкции на веб-страницах или внутри изображений могут конфликтовать с вашим исходным намерением. Поэтому Anthropic советует изоляцию окружения, минимальные привилегии, ограничение доступа к чувствительным аккаунтам и подтверждение человеком действий с реальными последствиями.
Четвёртое ограничение — демонстрационный код не равен production-архитектуре. Официальный quickstart Anthropic прямо предупреждает, что референсная реализация минимальна, слабо разделяет компоненты и рассчитана скорее на обучение и эксперимент, чем на многопользовательскую боевую систему. Это честное и полезное предупреждение: Computer Use нельзя безопасно внедрять, просто «запустив демо».
Пятое ограничение — историческая путаница версий. В документации Anthropic эта волна релиза проходит с суффиксом 20241022, но нынешние документы уже описывают более поздние инструменты, версии и улучшения. Если вы разбираете релиз октября 2024 года, нельзя автоматически переносить на него все возможности, которые появились в API позже.
Вывод
Computer Use от Anthropic в релизе 22 октября 2024 года — это важный шаг к агентам, которые работают не через специально написанные интеграции, а через обычный экран. Технически это означает связку из визуального восприятия, пиксельного заземления, планирования действий и аккуратно построенного внешнего цикла исполнения.
Но материалы самого Anthropic-старта достаточно честны: способность была ранней, медленной и подверженной ошибкам. Практический смысл релиза не в том, что Claude уже «умеет работать за вас за компьютером», а в том, что стало понятно, как вообще может выглядеть этот класс интерфейсов — и какие ограничения придётся решать инженерам, прежде чем он станет надёжным.
Источники
- Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku
- Developing a computer use model
- Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnet
- Computer use tool — Claude Platform Docs
- claude-quickstarts/computer-use-demo/README.md at main · anthropics/claude-quickstarts · GitHub
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
- OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
- API Vertex AI — Anthropic Docs
- Claude Code GitHub Actions — Anthropic Docs
FAQ
Computer Use — это отдельная модель?
Нет. В октябре 2024 года Anthropic запускала эту способность вместе с обновлённым Claude 3.5 Sonnet; в документации семейство релиза помечается датой 20241022.
Чем Computer Use отличается от обычного tool use?
Обычный tool use вызывает заранее описанные функции. Computer Use добавляет слой работы с GUI: модель смотрит на скриншот и просит внешний код выполнить клик, ввод текста или нажатие клавиш в изолированном окружении.
Почему результат на OSWorld оказался таким низким?
Потому что задача сложная: нужно распознавать интерфейс, переводить его в координаты, планировать длинную последовательность шагов и устойчиво восстанавливаться после ошибок. Даже увеличение числа шагов помогло лишь частично.
Где Computer Use уместен на практике?
Там, где нет API или он слишком дорог в интеграции: тестирование интерфейсов, сбор данных из старых внутренних систем, рутинные бэк-офисные workflow. Но для чувствительных действий нужен sandbox, журналирование и подтверждение человеком.
