
Агенты — самая перегретая категория в AI-инструментарии 2026 года. Каждая вторая презентация стартапа или опенсорс-релиза обещает «полностью автономного ассистента», который выполнит сложную задачу от начала до конца. На практике же после трёх лет активной разработки production-агенты остаются нишевым решением с жёсткими ограничениями.
Проблема не в том, что агенты не работают. Они работают — но только в строго определённых коридорах. Всё, что выходит за рамки чётко размеченного пайплайна, превращается в каскад ошибок, растущих счетов и невоспроизводимых результатов. Разберём, где именно находится предел, и что с этим делать инженеру, который не хочет тратить бюджет на демо.
Почему тема агентов стала критической
С середины 2024 года ведущие лаборатории — OpenAI, Anthropic, Google DeepMind — начали смещать фокус с одиночных LLM-запросов на мультишаговые агентные архитектуры. Anthropic выпустила системный гайд по построению агентов, где прямо указала: «начинайте с простейшего решения и усложняйте только по необходимости». Google представила Project Mariner — агента для браузера, способного выполнять цепочки действий. OpenAI запустила Operator и Deep Research.
Одновременно открытое сообщество пошло ещё дальше: фреймворки вроде LangGraph, CrewAI и AutoGen позволяют собирать агентов из нескольких LLM-шагов за вечер. Проблема в том, что «за вечер» не равно «за неделю в production». Разрыв между прототипом и надёжной системой огромен, и его редко обсуждают в маркетинговых материалах.
Что показывают источники: три узких места
Официальные документы лабораторий честно фиксируют ограничения. В техническом отчёте OpenAI по Deep Research указано, что агент успешно справляется с задачами, требующими до 30 шагов, но точность падает на 15–20% при увеличении длины цепочки. Anthropic в своём гайде предупреждает: «агенты добавляют задержки и стоимость, часто без пропорционального выигрыша в качестве».
Три главных узких места, подтверждённых и официальными источниками, и инженерным сообществом:
Воспроизводимость. Один и тот же агент с одинаковыми настройками может выдать разный результат при повторном запуске. Это не баг, а свойство вероятностных моделей. Для задач, где требуется детерминированность (расчёты, валидация данных, генерация кода), это критично.
Ценообразование. Агент с 10–15 шагами может стоить в 5–10 раз дороже одного вызова LLM. Если шаг включает RAG, веб-поиск или вызов внешнего API, стоимость растёт линейно с числом ошибок и повторных попыток.
Мониторинг и отладка. Когда агент выполняет цепочку из 20 шагов, понять, на каком именно этапе произошёл сбой, без инструментов трейсинга практически невозможно. LangSmith, Weights & Biases и Arize AI частично решают эту проблему, но стандарта пока нет.
Исследователи из Berkeley AI Research (BAIR) в статье 2025 года отметили, что текущие агентные бенчмарки — SWE-bench, GAIA, AgentBench — измеряют успешность в изолированной среде, которая плохо коррелирует с реальными условиями: сетевыми задержками, неполными данными и неоднозначными инструкциями.
Практический воркфлоу: когда агент оправдан
Из сказанного не следует, что агенты бесполезны. Есть чёткие сценарии, где они дают измеримый выигрыш. На основе анализа production-кейсов от Anthropic, LangChain и сообщества можно выделить три рабочие схемы:
| Сценарий | Пример | Оправданность агента |
|---|---|---|
| Одношаговый инструмент с фиксированным контекстом | Извлечение данных из PDF по шаблону | Высокая — детерминированность не нужна |
| Мультишаговый, но с жёстким графом | Конвейер обработки заявок: проверка → классификация → ответ | Средняя — нужен трейсинг и fallback |
| Мультишаговый с динамическим планированием | Автономный исследователь с веб-поиском | Низкая — высокая стоимость и непредсказуемость |
На практике агенты работают надёжно, когда каждый шаг имеет чёткий вход и выход, а число возможных ветвлений ограничено. Как только агенту даётся свобода выбора следующего действия, вероятность ошибки растёт экспоненциально.
Где находятся реальные ограничения
Контраргумент, который часто слышишь от энтузиастов: «модели становятся умнее, и проблема решится сама собой». Это не так. Даже с GPT-5 или Claude 4 агенты будут сталкиваться с теми же структурными проблемами:
- Отсутствие долговременной памяти. Сессия агента — это временный контекст. Как только окно внимания заполняется, агент начинает «забывать» ранние шаги. Решения вроде MemGPT или Letta частично снимают проблему, но добавляют сложность и стоимость.
- Невозможность гарантировать корректность. В отличие от традиционного ПО, где unit-тесты покрывают большинство путей выполнения, для LLM-агентов полное покрытие невозможно. Каждый вызов модели — это новая генерация, которую нельзя протестировать заранее.
- Отсутствие стандартов безопасности. Агенты с доступом к внешним инструментам — email, базам данных, API — создают поверхность атаки, которую сложно контролировать. OpenAI Operator явно ограничивает действия агента в браузере, но в опенсорс-фреймворках таких защит нет.
Анна Лебедева, специалист по безопасности AI-систем, в своём анализе 2025 года отметила, что «агент с доступом к электронной почте или платёжному API — это угроза, которой мы пока не умеем управлять на уровне инженерных практик».
Что тестировать вместо внедрения
Вместо того чтобы пытаться внедрить «полностью автономного агента» в production, стоит начать с измеримых экспериментов. Вот что можно проверить за неделю без риска для бюджета:
Стоимость одного успешного выполнения. Запустите агента на 10 разных задачах, посчитайте среднюю стоимость. Если она превышает стоимость ручного выполнения — агент не готов.
Процент успешных завершений. Если агент не доходит до конца в 80% случаев — архитектура слишком сложна. Упрощайте граф.
Воспроизводимость при повторном запуске. Запустите одну задачу 5 раз с одинаковыми входными данными. Если результаты различаются — нужны детерминированные шаги или валидация на каждом этапе.
Время выполнения. Агент, который решает задачу за 5 минут вместо 30 секунд ручной работы, не даёт выигрыша, даже если автоматизация кажется «крутой».
Эти четыре метрики — минимальный набор для принятия решения. Если хотя бы одна из них не проходит, агентный подход требует пересмотра.
Что дальше
Агенты не умрут. Они станут более специализированными и менее разрекламированными. Уже сейчас виден тренд на «агентов с ограничениями» — системы, где модель не планирует действия, а выполняет заранее размеченный граф. Такой подход используется в CustomerGPT, Copy.ai и некоторых internal-инструментах крупных компаний.
Следующий шаг для инженера — не гнаться за автономностью, а строить систему с чёткими границами: где агент принимает решение, а где — просто выполняет шаблон. И обязательно закладывать мониторинг с первого дня.
Проверьте свои текущие прототипы по четырём метрикам выше. Если хотя бы одна заваливается — возможно, агентный подход пока не ваш инструмент.
