Запись архива

Автономный агент на базе Claude: как Anthropic переосмысливает компьютерное взаимодействие

Anthropic выпустила бета-функцию computer use для Claude 3.5 Sonnet — модель может самостоятельно смотреть на экран, перемещать курсор, кликать и вводить текст. Разбираем, как это работает, какие ограничения есть у агента и где его уже тестируют.

Интерфейс демонстрации функции computer use от Anthropic — Claude 3.5 Sonnet управляет курсором и вводит текст в браузере
Интерфейс демонстрации функции computer use от Anthropic — Claude 3.5 Sonnet управляет курсором и вводит текст в браузере
Редакционная тематическая обложка COMRAD404

Anthropic выпустила бета-функцию computer use для своей флагманской модели Claude 3.5 Sonnet. Теперь модель может не просто генерировать текст, а буквально «видеть» экран, перемещать курсор, кликать по кнопкам, заполнять поля и выполнять многошаговые действия в графическом интерфейсе. В отличие от API-интеграций, которые требуют от разработчика прописывать каждый шаг, Claude сам определяет, куда нажать и что ввести.

Функция доступна в режиме беты, и команда Anthropic честно предупреждает: это эксперимент. На данный момент computer use может ошибаться, «застревать» на сложных интерфейсах и тратить время на визуальный осмотр экрана. Но сама по себе эта возможность открывает новую главу в развитии автономных AI-агентов.

Как устроен computer use

Computer use работает через API Anthropic. Разработчик передаёт модели скриншот экрана и текстовую инструкцию — например, «заполни форму регистрации» или «найди в таблице строку с суммой больше 1000 и выдели её». Claude анализирует изображение, определяет координаты элементов интерфейса и возвращает команды для перемещения мыши, кликов и набора текста.

Ключевая особенность — модель не использует DOM-структуру или метаданные интерфейса. Она работает исключительно с пикселями, как человек. Это значит, что Claude можно запустить на любом приложении, веб-сайте или даже на удалённом рабочем столе, где нет API.

Технически процесс выглядит так:

Шаг Действие Claude Что происходит на экране
1 Получает скриншот Модель «видит» текущее состояние интерфейса
2 Анализирует задачу Определяет, какой элемент нужно найти и активировать
3 Возвращает координаты клика (x, y) Курсор перемещается на кнопку или поле ввода
4 Выполняет клик или ввод текста Интерфейс реагирует, экран меняется
5 Получает новый скриншот Цикл повторяется до завершения задачи

Anthropic подчёркивает, что модель обучалась на синтетических данных, имитирующих взаимодействие с интерфейсами. Для безопасности Anthropic добавила классификатор, который блокирует действия на чувствительных сайтах — например, на страницах банковских операций или регистрации на правительственных порталах.

Где это уже тестируют

Первые разработчики, получившие доступ к бете, уже публикуют результаты. На Reddit и X появились видео, где Claude самостоятельно:

  • заполняет формы на十几个 вкладках браузера,
  • ищет товары на маркетплейсах и сравнивает цены,
  • работает с Google Sheets — копирует данные, сортирует строки, строит графики,
  • настраивает интерфейс IDE, открывая меню и изменяя параметры.

Один из пользователей отметил, что Claude справился с задачей, требующей 47 последовательных кликов, — навигация по многоуровневому меню SaaS-продукта. Человек потратил бы на это около минуты, модель — около трёх, но сделала всё без ошибок.

Конечно, есть и неудачные кейсы. Claude иногда кликает в пустое место, если фон интерфейса визуально похож на кнопку, или пытается взаимодействовать с элементами, которые скрыты за прокруткой. Модель не умеет скроллить так же плавно, как человек, — она делает дискретные шаги.

Ограничения и риски

Computer use — это бета, и Anthropic прямо указывает на несколько ограничений.

Во-первых, скорость. Модель тратит 1–3 секунды на анализ каждого скриншота. Для простых действий это приемлемо, но для сложных сценариев с десятками шагов время выполнения может быть в 10–20 раз больше, чем у человека.

Во-вторых, безопасность. Anthropic внедрила классификатор, который проверяет каждое действие перед выполнением. Если модель пытается открыть страницу банковского перевода или ввести данные на подозрительном сайте, классификатор блокирует действие. Однако сама компания признаёт, что в бета-версии возможны ложные срабатывания и пропуски угроз.

В-третьих, совместимость. Computer use тестировался на стандартных веб-интерфейсах и macOS. На Windows, Linux или в специфических корпоративных приложениях поведение модели может отличаться. Разработчикам рекомендуется тщательно тестировать сценарии на целевых конфигурациях.

И наконец, стоимость. Каждый шаг computer use — это отдельный API-запрос с передачей изображения. Для задач с 20–30 шагами затраты могут быть существенно выше, чем при обычном текстовом вызове модели.

Что это значит для разработчиков агентов

Функция computer use — это шаг к универсальным AI-агентам, которые не требуют специальной интеграции с каждым сервисом. Если раньше для автоматизации работы с CRM нужно было писать код через их API, то теперь достаточно дать модели доступ к экрану и описать задачу на естественном языке.

Для разработчиков это означает:

  • снижение порога входа для автоматизации — не нужно изучать документацию каждого сервиса,
  • возможность работать с legacy-системами, у которых нет API,
  • новые сценарии тестирования UI — модель может проверять интерфейсы на пользовательские сценарии.

При этом computer use не заменяет традиционные API-интеграции для задач, где нужна скорость и надёжность. Для массовых операций (например, отправка тысяч писем) прямой API остаётся предпочтительным.

Практические выводы

Computer use от Anthropic — не готовый продукт, а исследовательский прототип. Если вы хотите попробовать его в своём проекте, начните с простых задач с чётким визуальным интерфейсом и ограниченным числом шагов. Не используйте функцию для операций с финансами, персональными данными или в системах, где ошибка критична.

Проверяйте логи каждого действия: Claude возвращает не только координаты кликов, но и текстовое описание того, что он собирается сделать. Это позволяет отлавливать неверные решения на раннем этапе.

Документация Anthropic рекомендует устанавливать тайм-аут на выполнение задачи и ограничивать количество шагов. Если модель зацикливается или повторяет одно и то же действие, стоит пересмотреть инструкцию или добавить дополнительный контекст о структуре интерфейса.

Computer use доступен в API Anthropic для Claude 3.5 Sonnet. Для доступа к бете нужно подать заявку через консоль разработчика. Полноценный релиз с улучшенной скоростью и безопасностью ожидается не раньше 2026 года.