Запись архива

Персональные AI-агенты: как устроена и почему не взлетела платформа Adept

История стартапа Adept — от $350 млн инвестиций до продажи Amazon и Atoma — показывает, почему создание универсального ИИ-агента для рабочего стола оказалось сложнее, чем предполагали основатели.

Интерфейс AI-агента Adept, демонстрирующий автоматизацию действий на рабочем столе
Интерфейс AI-агента Adept, демонстрирующий автоматизацию действий на рабочем столе
David Pham.jpg | by Photos by flipchip / LasVegasVegas.com | wikimedia_commons | CC BY-SA 3.0

Весной 2023 года стартап Adept вышел из тени с амбициозной идеей: построить универсального AI-агента, который мог бы выполнять любые действия на компьютере — от заполнения таблиц до навигации по корпоративным CRM. Команда состояла из бывших инженеров OpenAI и Google, а сумма привлечённых инвестиций превысила $350 млн. Однако к середине 2024 года компания фактически прекратила самостоятельное существование: ключевые сотрудники перешли в Amazon, а технология была продана стартапу Atoma.

Для практикующих разработчиков и продакт-менеджеров история Adept — не просто очередной стартап-кейс. Это иллюстрация фундаментальных ограничений подхода «агент как замена GUI», который до сих пор остаётся одной из самых горячих тем в AI-сообществе.

Что обещал и как работал Adept

Основатели — Дэвид Луан (бывший вице-президент OpenAI), Ники Пармар (соавтор архитектуры Transformer) и Ашиш Васвани (соавтор Attention is All You Need) — позиционировали Adept как шаг к AGI. Их продукт, названный ACT-1, представлял собой модель, обученную имитировать действия человека с интерфейсом: клики, ввод текста, прокрутку, переключение вкладок.

Пользователь давал агенту задание на естественном языке: «Найди в Salesforce сделки на сумму более $50k и экспортируй в Google Sheets». Модель запускала виртуальный браузер, последовательно выполняла действия и возвращала результат.

Демонстрации выглядели впечатляюще. Однако за ними скрывалась ключевая проблема: модель не понимала семантику интерфейса — она лишь повторяла паттерны, на которых была обучена. Любое изменение дизайна, обновление кнопки или смена расположения элементов ломали сценарий.

Почему агент не стал массовым продуктом

Официальные заявления Adept и последующие отчёты инсайдеров в The Information и TechCrunch позволяют выделить три группы причин, почему продукт не взлетел.

Первая — техническая хрупкость. ACT-1 работал в sandbox-браузере и требовал стабильной DOM-структуры страниц. На реальных веб-приложениях с динамическим контентом (React, Angular) точность выполнения падала ниже 60%. Это делало продукт непригодным для enterprise-задач, где ошибка в цепочке действий может стоить дорого.

Вторая — конкуренция с API. Вместо того чтобы эмулировать клики, enterprise-интеграторы могут использовать API — они быстрее, надёжнее и дешевле. Adept пытался решить задачу, которая уже имела инженерное решение, но не для конечного пользователя, а для разработчика.

Третья — бизнес-модель. Продукт требовал постоянной поддержки совместимости с тысячами сайтов и приложений. Каждое обновление CRM, ERP или HR-системы могло сломать агента. Поддержка такого уровня силами одного стартапа оказалась непосильной.

Что произошло с командой и технологией

В июне 2024 года Amazon наняла сооснователей Луана и Пармара, а также значительную часть исследовательской команды. В официальном блоге Adept говорилось, что технология будет использоваться для «ускорения разработки AI-агентов в Amazon». Однако, по данным источников Bloomberg, речь шла скорее о покупке талантов, чем о приобретении готового продукта.

Оставшаяся часть интеллектуальной собственности была продана стартапу Atoma, который переориентировался на создание AI-агентов для разработчиков — с фокусом на интеграцию через код, а не через эмуляцию GUI.

С точки зрения рынка, Adept повторил путь многих «универсальных агентов»: продукт оказался слишком общим для массового пользователя и недостаточно надёжным для корпоративного клиента.

Что это значит для инженеров и продактов

История Adept даёт несколько практических уроков для тех, кто строит или выбирает AI-агентов сегодня.

Аспект Вывод из кейса Adept Практическая рекомендация
Интерфейс взаимодействия GUI-эмуляция хрупка и масштабируется плохо Используйте API или headless-браузеры с селекторами
Обучение модели Имитация действий без понимания контекста даёт <60% точности на динамике Добавляйте семантические аннотации к интерфейсу
Enterprise-готовность Поддержка совместимости с N приложениями требует команды размером с Microsoft Фокусируйтесь на 1-2 платформах или дайте SDK
Бизнес-модель Потребительский рынок требует zero-maintenance Закладывайте стоимость адаптации в enterprise-лицензию

Первое. Если вы разрабатываете агента для работы с веб-приложениями, откажитесь от эмуляции кликов в пользу прямого манипулирования DOM через Playwright или Puppeteer. Это даёт детерминированное выполнение и упрощает отладку.

Второе. Для корпоративных сценариев используйте API-шлюзы. Агент, который вызывает REST-эндпоинты вместо эмуляции браузера, будет работать в десятки раз быстрее и с предсказуемой задержкой.

Третье. Если вы выбираете платформу для автоматизации, проверьте, как она обрабатывает изменения интерфейса. Наличие визульных регрессионных тестов и fallback-стратегий — обязательное условие для production.

Где сейчас границы применимости

Важно не впадать в другую крайность и не списывать со счетов все AI-агенты. Узкие, специализированные решения показывают хорошие результаты.

Например, GitHub Copilot работает в строго определённой среде (IDE) и не пытается эмулировать произвольные GUI. Аналогично, агенты для автоматизации тестирования (Testim, Mabl) строятся на основе селекторов и семантического анализа, а не на имитации действий.

Основное ограничение, которое вскрыл Adept — отсутствие надёжного способа передавать контекст между шагами в произвольном интерфейсе. Пока эта проблема не решена на уровне архитектуры модели, универсальные GUI-агенты останутся экспериментальной технологией.

Что можно проверить уже сегодня

Для тех, кто хочет оценить текущее состояние технологии, есть несколько доступных вариантов.

Попробуйте open-source проекты, которые решают похожую задачу, но с другим подходом: Browser-Use (использует Playwright и LLM для навигации) или Open-Interpreter (работает через терминал, а не через GUI). Разница в надёжности и скорости будет заметна сразу.

Если вы работаете в enterprise, запросите демо у платформ, которые специализируются на RPA с AI-слоем — например, UiPath с AI Agent Builder или Microsoft Copilot Studio. Они используют гибридный подход: API-вызовы для транзакций и компьютерное зрение для legacy-интерфейсов.

Главный вывод из истории Adept прост: AI-агент не должен заменять интерфейс — он должен дополнять его там, где это даёт измеримый выигрыш в скорости или качестве. Остальное — пока что область исследований, а не production-развёртываний.