
Anthropic выпустила бета-функцию computer use для своей флагманской модели Claude 3.5 Sonnet. Теперь модель может не просто генерировать текст, а буквально «видеть» экран, перемещать курсор, кликать по кнопкам, заполнять поля и выполнять многошаговые действия в графическом интерфейсе. В отличие от API-интеграций, которые требуют от разработчика прописывать каждый шаг, Claude сам определяет, куда нажать и что ввести.
Функция доступна в режиме беты, и команда Anthropic честно предупреждает: это эксперимент. На данный момент computer use может ошибаться, «застревать» на сложных интерфейсах и тратить время на визуальный осмотр экрана. Но сама по себе эта возможность открывает новую главу в развитии автономных AI-агентов.
Как устроен computer use
Computer use работает через API Anthropic. Разработчик передаёт модели скриншот экрана и текстовую инструкцию — например, «заполни форму регистрации» или «найди в таблице строку с суммой больше 1000 и выдели её». Claude анализирует изображение, определяет координаты элементов интерфейса и возвращает команды для перемещения мыши, кликов и набора текста.
Ключевая особенность — модель не использует DOM-структуру или метаданные интерфейса. Она работает исключительно с пикселями, как человек. Это значит, что Claude можно запустить на любом приложении, веб-сайте или даже на удалённом рабочем столе, где нет API.
Технически процесс выглядит так:
| Шаг | Действие Claude | Что происходит на экране |
|---|---|---|
| 1 | Получает скриншот | Модель «видит» текущее состояние интерфейса |
| 2 | Анализирует задачу | Определяет, какой элемент нужно найти и активировать |
| 3 | Возвращает координаты клика (x, y) | Курсор перемещается на кнопку или поле ввода |
| 4 | Выполняет клик или ввод текста | Интерфейс реагирует, экран меняется |
| 5 | Получает новый скриншот | Цикл повторяется до завершения задачи |
Anthropic подчёркивает, что модель обучалась на синтетических данных, имитирующих взаимодействие с интерфейсами. Для безопасности Anthropic добавила классификатор, который блокирует действия на чувствительных сайтах — например, на страницах банковских операций или регистрации на правительственных порталах.
Где это уже тестируют
Первые разработчики, получившие доступ к бете, уже публикуют результаты. На Reddit и X появились видео, где Claude самостоятельно:
- заполняет формы на十几个 вкладках браузера,
- ищет товары на маркетплейсах и сравнивает цены,
- работает с Google Sheets — копирует данные, сортирует строки, строит графики,
- настраивает интерфейс IDE, открывая меню и изменяя параметры.
Один из пользователей отметил, что Claude справился с задачей, требующей 47 последовательных кликов, — навигация по многоуровневому меню SaaS-продукта. Человек потратил бы на это около минуты, модель — около трёх, но сделала всё без ошибок.
Конечно, есть и неудачные кейсы. Claude иногда кликает в пустое место, если фон интерфейса визуально похож на кнопку, или пытается взаимодействовать с элементами, которые скрыты за прокруткой. Модель не умеет скроллить так же плавно, как человек, — она делает дискретные шаги.
Ограничения и риски
Computer use — это бета, и Anthropic прямо указывает на несколько ограничений.
Во-первых, скорость. Модель тратит 1–3 секунды на анализ каждого скриншота. Для простых действий это приемлемо, но для сложных сценариев с десятками шагов время выполнения может быть в 10–20 раз больше, чем у человека.
Во-вторых, безопасность. Anthropic внедрила классификатор, который проверяет каждое действие перед выполнением. Если модель пытается открыть страницу банковского перевода или ввести данные на подозрительном сайте, классификатор блокирует действие. Однако сама компания признаёт, что в бета-версии возможны ложные срабатывания и пропуски угроз.
В-третьих, совместимость. Computer use тестировался на стандартных веб-интерфейсах и macOS. На Windows, Linux или в специфических корпоративных приложениях поведение модели может отличаться. Разработчикам рекомендуется тщательно тестировать сценарии на целевых конфигурациях.
И наконец, стоимость. Каждый шаг computer use — это отдельный API-запрос с передачей изображения. Для задач с 20–30 шагами затраты могут быть существенно выше, чем при обычном текстовом вызове модели.
Что это значит для разработчиков агентов
Функция computer use — это шаг к универсальным AI-агентам, которые не требуют специальной интеграции с каждым сервисом. Если раньше для автоматизации работы с CRM нужно было писать код через их API, то теперь достаточно дать модели доступ к экрану и описать задачу на естественном языке.
Для разработчиков это означает:
- снижение порога входа для автоматизации — не нужно изучать документацию каждого сервиса,
- возможность работать с legacy-системами, у которых нет API,
- новые сценарии тестирования UI — модель может проверять интерфейсы на пользовательские сценарии.
При этом computer use не заменяет традиционные API-интеграции для задач, где нужна скорость и надёжность. Для массовых операций (например, отправка тысяч писем) прямой API остаётся предпочтительным.
Практические выводы
Computer use от Anthropic — не готовый продукт, а исследовательский прототип. Если вы хотите попробовать его в своём проекте, начните с простых задач с чётким визуальным интерфейсом и ограниченным числом шагов. Не используйте функцию для операций с финансами, персональными данными или в системах, где ошибка критична.
Проверяйте логи каждого действия: Claude возвращает не только координаты кликов, но и текстовое описание того, что он собирается сделать. Это позволяет отлавливать неверные решения на раннем этапе.
Документация Anthropic рекомендует устанавливать тайм-аут на выполнение задачи и ограничивать количество шагов. Если модель зацикливается или повторяет одно и то же действие, стоит пересмотреть инструкцию или добавить дополнительный контекст о структуре интерфейса.
Computer use доступен в API Anthropic для Claude 3.5 Sonnet. Для доступа к бете нужно подать заявку через консоль разработчика. Полноценный релиз с улучшенной скоростью и безопасностью ожидается не раньше 2026 года.
