22 октября 2024 года Anthropic выпустила обновлённую Claude 3.5 Sonnet и одновременно открыла публичную beta-функцию Computer Use. В этом режиме модель не получает специальный API под каждый сайт или программу: она видит скриншот, предлагает действия мышью и клавиатурой, а внешняя среда исполняет их и возвращает новый скриншот. Ниже — разбор именно того, что было заявлено и показано в релизе 22 октября 2024 года, без подмены темы более поздними результатами 2025–2026 годов.
Коротко
- Computer Use в релизе Anthropic от 22 октября 2024 года — это не «автономный сотрудник в ОС», а агентный цикл: задача пользователя, скриншот, действие, новый скриншот.
- Anthropic сообщила о 14.9% на OSWorld в screenshot-only постановке и о 22.0% при увеличении лимита шагов; для ориентира в самой работе OSWorld человеческий baseline указан как 72.36%.
- Ключевая исследовательская проблема, по словам Anthropic, была не только в планировании, но и в GUI-grounding: модель нужно было научить соотносить экран с координатами и «считать пиксели» для кликов.
- Релиз важен тем, что переносит агентность с уровня специальных интеграций на уровень обычного интерфейса ПК. Но по состоянию на октябрь 2024 года это всё ещё медленный и хрупкий режим.
- Для практики главный вывод простой: Computer Use имеет смысл только в изолированной среде, с минимальными правами, ограничением доменов и человеком в цикле для чувствительных действий.
Контекст
До Computer Use большинство «агентных» сценариев для LLM опирались на заранее подготовленные инструменты: отдельный tool для поиска, отдельный tool для редактора, отдельный API для CRM, браузера или терминала. Это работает там, где интеграцию можно спроектировать заранее. Но в реальной работе много задач живут в старых веб-интерфейсах, десктопных приложениях и внутренних системах без удобного API.
Anthropic прямо описала релиз как переход от мира, где инструменты подгоняют под модель, к миру, где модель подгоняют под обычные человеческие инструменты. Это важная формулировка: в центре здесь не новая абстрактная «разумность», а новый интерфейс доступа к цифровой среде.
Важно и то, что речь идёт именно об обновлённой октябрьской версии Claude 3.5 Sonnet. Позже METR отдельно уточняла, что её опубликованная в конце октября 2024 года внешняя оценка касалась июньской версии claude-3-5-sonnet-20240620, а не новой октябрьской версии claude-3-5-sonnet-20241022. Для исторического разбора это различие существенно: иначе легко смешать два разных состояния модели.
Anthropic в релизном посте также назвала Claude 3.5 Sonnet «первой frontier-моделью» с computer use в public beta. Это корректно передаёт позицию компании, но сама категория frontier здесь остаётся маркетингово-операционной, а не независимой академической классификацией.
Метод
Что такое Computer Use на уровне системы
По описанию Anthropic, модель получает текстовую цель пользователя и изображения экрана. Дальше она выдаёт команды GUI-уровня: перемещение курсора, клик, ввод текста и другие действия, которые исполняет внешняя среда. После исполнения действия система делает новый скриншот и возвращает его модели. Так повторяется цикл наблюдение → действие → новое наблюдение.
пользовательская цель + скриншот -> Claude Claude -> GUI-действие внешняя среда исполняет действие внешняя среда возвращает новый скриншот цикл повторяется до завершения или лимита шагов
Из этого следует важное практическое следствие: Computer Use — не встроенный «оператор ПК» внутри модели, а внешний агентный контур. Официальный quickstart Anthropic показывал именно такую схему: контейнеризированная среда с рабочим столом Linux, VNC и приложением, которое прогоняет агентный цикл.
На чём, по словам Anthropic, был сделан исследовательский прорыв
В отдельном посте о разработке Anthropic пишет, что критически важным оказалось умение модели правильно соотносить изображение экрана с координатами курсора. Исследователи прямо выделяют задачу pixel counting: модель должна понимать, на сколько пикселей сдвинуться по вертикали и горизонтали, чтобы кликнуть в нужное место.
Это полезное уточнение для практиков. В desktop-агентах узкое место часто не в общем рассуждении, а в «приземлении» этого рассуждения к интерфейсу: распознать нужный элемент, не перепутать соседние кнопки, не потерять контекст после скролла, не кликнуть на модальное окно вместо основной цели.
Anthropic также пишет, что на этапе обучения не давала модели доступ к интернету и использовала немного простого ПО вроде калькулятора и текстового редактора, после чего наблюдала неожиданно быструю генерализацию на более широкий класс задач. Это объясняет, почему релиз 2024 года был скорее демонстрацией общего навыка GUI-взаимодействия, чем узко настроенным ботом под один сайт.
Почему в качестве основного теста выбран OSWorld
OSWorld хорошо подходит под такой тип агента, потому что измеряет работу в реальной компьютерной среде, а не только ответы в чате. Авторы OSWorld сами описывают бенчмарк как набор из 369 задач с веб- и десктоп-приложениями, файловыми операциями ОС и многошаговыми workflow. Ещё одна сильная сторона OSWorld — execution-based evaluation: задача считается не по субъективному впечатлению, а по исполняемым проверкам.
Есть и важная тонкость. В системной карте Anthropic сказано, что её оценка шла в режиме screenshot only, хотя сам OSWorld допускает и другие каналы наблюдения, например accessibility tree в текстовом виде. Поэтому OSWorld здесь — уместный, но не полностью однозначный тест: результат зависит не только от модели, но и от того, что именно ей разрешено видеть.
Результаты
Главная цифра релиза — 14.9% на OSWorld в screenshot-only режиме. В системной карте Anthropic добавляет, что при увеличении лимита шагов со стандартных 15 до 50 показатель вырос до 22.0%. Для сравнения, в статье OSWorld человеческий baseline указан как 72.36%.
| Оценка | Настройка | Значение | Сравнение | Что это значит |
|---|---|---|---|---|
| OSWorld | Screenshot only, стандартный лимит | 14.9% | 72.36% у человека в статье OSWorld | Модель уже умеет выполнять часть реальных GUI-задач, но до человеческой надёжности очень далеко. |
| OSWorld | Screenshot only, больше шагов | 22.0% | 72.36% у человека в статье OSWorld | Часть провалов связана не с полной неспособностью, а с длиной траектории и восстановлением после ошибок. |
| SWE-bench Verified | Обновлённая Claude 3.5 Sonnet, релиз 22.10.2024 | 49.0% | 45.2% — текущий SOTA на leaderboard по состоянию на 22.10.2024, по системной карте Anthropic | Октябрьский апгрейд усилил не только GUI-режим, но и более широкий агентный стек модели. |
| OSWorld, ближайший AI-конкурент в comparator Anthropic | Screenshot only | 7.7%–7.8% | 14.9% у Claude 3.5 Sonnet | Два поста Anthropic расходятся на 0.1 п.п. по округлению, но оба указывают на заметный отрыв внутри этой узкой постановки. |
Здесь есть методологический нюанс, который важно не потерять. В статье OSWorld, ревизия от 30 мая 2024 года, лучший результат модели в общей постановке описан как 12.24%. Anthropic же в октябре 2024 года сравнивает свои 14.9% с 7.7%–7.8% в screenshot-only категории. Эти две линии сравнения не полностью взаимозаменяемы: одна относится к общему состоянию бенчмарка на момент публикации статьи, другая — к более узкому режиму наблюдения, который Anthropic считает принципиальным для «человекообразного» компьютерного использования.
Ещё одна важная деталь: сама Anthropic в релизном посте называет Computer Use экспериментальным и неудобным в ряде типовых действий. Это редкий случай, когда ограничения вынесены не в мелкий шрифт, а в центральное описание результата. Для практиков это полезнее, чем сухое SOTA-заявление.
Интерпретация
Наш комментарий
Если убрать рекламочный слой, октябрьский релиз Anthropic показал не «ИИ, который освоил компьютер», а смену слоя абстракции. Раньше агенту обычно давали специально подготовленные инструменты. Здесь Anthropic пробует сделать GUI универсальным интерфейсом. Проще говоря, пользовательский интерфейс начинает играть роль грубого, но почти везде доступного API.
Это важно именно для практики. Во многих компаниях автоматизация упирается не в отсутствие модели, а в отсутствие доступа к системам: старый внутренний портал, Excel-макросы, веб-формы поставщиков, десктопный софт, который никто не собирается интегрировать заново. Computer Use предлагает обходной путь. Но цена такого обхода — хрупкость: если интерфейс немного сдвинулся, всплыло окно, задержалась загрузка или изменилась кнопка, агент теряет устойчивость.
Рост с 14.9% до 22.0% при большем числе шагов тоже показателен. Он намекает, что часть ошибок лежит не в «незнании, что делать», а в траекторной устойчивости: модель может выбрать в целом верную стратегию, но не довести её до конца из-за одного неудачного шага, потери состояния или нехватки попыток на исправление.
Наконец, связка с SWE-bench Verified здесь тоже не случайна. Октябрьская Claude 3.5 Sonnet усилилась как агент не только на экране, но и в инструментальных задачах разработки. Это косвенно поддерживает тезис, что Computer Use в 2024 году был не самостоятельной магией, а ещё одним внешним контуром для уже растущих агентных способностей модели.
Ограничения
Первое и главное ограничение — огромный разрыв до человека. Даже 22.0% в режиме с увеличенным числом шагов против 72.36% человеческого baseline означает, что на длинных и разнородных задачах режим был далёк от надёжной автономии.
Второе ограничение — сам тип восприятия. Anthropic прямо пишет о «flipbook»-эффекте: модель видит не непрерывный видеопоток, а последовательность скриншотов. Из-за этого она может пропускать короткоживущие уведомления, анимации, всплывающие состояния и вообще всё, что легко ухватывает человек, наблюдая экран в реальном времени.
Третье — механические действия интерфейса. В релизных материалах Anthropic отдельно оговаривает трудности со скроллом, drag-and-drop и zoom. Это кажется мелочью, пока не вспомнить, что именно такие операции постоянно встречаются в реальных системах: таблицы, канбан-доски, файловые менеджеры, карты, графические редакторы, IDE.
Четвёртое — безопасность. И системная карта Anthropic, и официальный quickstart рекомендуют запускать Computer Use в выделенной виртуальной машине или контейнере, не давать доступ к чувствительным данным, ограничивать интернет списком необходимых доменов и оставлять человека в цикле для действий с реальными последствиями. Это не перестраховка, а прямое следствие уязвимости к prompt injection: если модель читает экран и сайты, то вредоносные инструкции на странице становятся частью её входа.
Пятое — зависимость от scaffolding. Результаты Computer Use неотделимы от того, как именно устроен внешний цикл: сколько шагов разрешено, как часто делаются скриншоты, как кодируется история, как обрабатываются ошибки и повторы. Поэтому нельзя переносить цифры из релизного поста в свою инфраструктуру без поправки на реализацию.
Наконец, шестое — границы заявлений о безопасности. Anthropic относит этот релиз к ASL-2 и пишет, что не видит признаков катастрофического риска. Но список злоупотреблений и потенциальных уязвимостей в системной карте дан прежде всего с позиции самой компании. Независимая публичная проверка именно октябрьского Computer Use была ограниченной, и это стоит помнить при любых сильных выводах.
Заключение
Релиз Anthropic от 22 октября 2024 года был важен не потому, что Claude внезапно «научилась пользоваться компьютером как человек», а потому, что лаборатория показала жизнеспособный шаблон GUI-агента на базе сильной мультимодальной модели. Computer Use в той версии уже мог выполнять часть реальных задач, но оставался медленным, хрупким и чувствительным к устройству внешнего цикла.
Если вы смотрите на этот релиз как практик, главный урок такой: Computer Use — это полезный интерфейсный слой для автоматизации там, где нет хорошего API, а не замена надёжной интеграции. Его нужно оценивать как внешнего агента в песочнице, а не как готового автономного оператора рабочего стола.
Источники
- Anthropic, 2024. Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku.
- Anthropic, 2024. Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnet.
- Anthropic, 2024. Developing a computer use model.
- Tianbao Xie и др., 2024. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments.
- Anthropic, GitHub. Anthropic Computer Use Demo README.
- METR, 2024. Details about METR’s preliminary evaluation of Claude 3.5 Sonnet.
FAQ
Computer Use — это просто ещё один tool use?
И да, и нет. Да — потому что модель по-прежнему работает через внешний инструментальный контур. Нет — потому что вместо специализированного API она опирается на общий GUI-слой: скриншоты, координаты, клики и ввод с клавиатуры.
Можно ли по результату 14.9% сказать, что агент уже готов к офисной рутине?
Нет. Релиз показывает, что подход работает в принципе, но цифры OSWorld и сами оговорки Anthropic указывают на экспериментальный статус. Для узких, низкорисковых и хорошо ограждённых сценариев — возможно. Для широкого автономного desktop-оператора — ещё нет.
Почему рост до 22.0% при большем лимите шагов так важен?
Потому что он показывает характер ошибок. По крайней мере часть провалов связана с длиной траектории, исправлением промежуточных промахов и навигацией, а не только с отсутствием «понимания задачи» как такового.
Где основной риск в продакшене?
Основной риск — сочетание низкой надёжности с высокими привилегиями. Если агент видит интернет, имеет доступ к аккаунтам и может совершать внешние действия, то prompt injection и простые GUI-ошибки быстро превращаются в операционные инциденты.
