Запись архива

Визуальный «Фотошоп» для агентов: Open‑source инструмент меняет UX/UI агентивного ИИ

Разработчик представил claw‑совместимый плагин, позволяющий «рисовать» и указывать на элементы интерфейса вместо написания длинных промптов. Инструмент уже протестирован в full‑stack разработке, симуляциях и робототехнике.

Интерфейс визуального инструмента для агентивного ИИ: пользователь рисует стрелку и обводит область на скриншоте
Интерфейс визуального инструмента для агентивного ИИ: пользователь рисует стрелку и обводит область на скриншоте
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-37).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Что произошло

Пользователь Reddit под ником Pleasant-Taste1417 опубликовал в разделе r/artificial анонс собственного open‑source плагина, который меняет способ взаимодействия с AI‑агентами. Инструмент, описанный автором как «агентивный фотошоп», позволяет не копировать скриншоты или записи экрана в текстовый промпт, а прямо на изображении (или в окне приложения) рисовать, обводить, ставить стрелки и указывать на элементы, которые требуется изменить. Проект выложен на ClawHub (аналог GitHub) и совместим с Linux; в разработке — плагины для Cursor и Claude Code.

Как это работает

Вместо того чтобы писать «сделай кнопку Submit синей и перемести её на 20 пикселей вправо», пользователь открывает скриншот или активное окно, выбирает инструмент (кисть, прямоугольник, стрелка, ластик), делает пометку прямо на интерфейсе и отправляет агенту. Агент (поддерживаются, судя по контексту, Claude API и локальные модели) анализирует визуальную разметку и генерирует код или команды, соответствующие указанным изменениям.

Автор утверждает, что такой подход должен стать новым слоем абстракции для любой агентивной платформы: панель инструментов настраивается под конкретный сценарий — от full‑stack веб‑разработки до симуляций и робототехники.

Почему это важно

Текущий UX агентивного ИИ построен вокруг текстовых диалогов. Даже при работе с визуальными данными (UI‑дизайн, скриншоты, видео) пользователь вынужден вербально описывать координаты, цвета и относительное расположение элементов. Это неудобно, долго и чревато ошибками — особенно если агент работает с нелинейными интерфейсами или симуляциями.

Визуальное указание (visual prompting) решает эту проблему: оно интуитивно, снижает когнитивную нагрузку и позволяет точнее передать намерение. В сочетании с агентами, способными интерпретировать произвольные аннотации, такой интерфейс может стать стандартом для AI‑инструментов разработчика — аналогично тому, как Photoshop или Figma заменили текстовые описания дизайна.

Ограничения и статус

На данный момент инструмент работает только под Linux. Плагины для Cursor и Claude Code находятся в разработке. Поддержка macOS и Windows не анонсирована. Код опубликован на ClawHub, но автор не указал точную лицензию — при использовании в коммерческих проектах стоит уточнить. В текущей версии нет встроенного механизма безопасности: агент получает полный доступ к аннотированному изображению, что может быть рискованно при работе с конфиденциальными данными.

Что дальше

Автор приглашает сообщество к обсуждению функциональности: какие инструменты и возможности добавить? Судя по комментариям, спрос на визуальный UX для агентов высок — идею поддержали как разработчики, так и специалисты по AI‑безопасности. Если проект получит кроссплатформенную поддержку и интеграцию с популярными AI‑агентами, он может стать одним из первых практических примеров «агентивного фотошопа» — интерфейса, где вы рисуете, а AI делает.

Источники

  • Оригинальный пост на Reddit: https://www.reddit.com/r/artificial/comments/1wh2xyp/visual_prompting_tool_the_next_uiux_for_agentic_ai/
  • Страница проекта на ClawHub (пост содержит ссылку)
  • Обсуждение визуального промптинга в контексте Claude: https://www.anthropic.com/news