ИИ-агенты выполнили больше операций при разработке Atria Dawn, но 85,5% решений остались за людьми

Анализ 769 журналов задач проекта Atria Dawn Preview показал: агенты участвовали почти во всей работе и предлагали методы, однако 85,5% решений о методах и параметрах принимали люди. Авторы предупреждают, что число действий агента нельзя считать мерой его автономности.

Разработка модели Atria Dawn Preview с участием людей и ИИ-агентов
Разработка модели Atria Dawn Preview с участием людей и ИИ-агентов
Изображение из исходного материала

Исследовательская команда с участием специалистов китайского Университета Фудань изучила, как распределялась работа между людьми и ИИ-агентами во время разработки языковой модели Atria Dawn Preview. Анализ охватил 769 журналов задач от 56 участников и логи использованных ими агентов.

По данным команды, ИИ применялся в 96,5% рассмотренных задач. При этом высокая доля автоматизированных операций не означала передачу агентам права определять направление работы. В решениях о методах и параметрах последнее слово в 85,5% случаев оставалось за людьми, сообщает The Decoder.

Это различие существенно для оценки агентных систем: журнал может содержать десятки вызовов инструментов, проверок и исправлений на одну человеческую команду, хотя цель, критерии успеха и выбор подхода по-прежнему задает специалист.

Что именно измеряла команда Atria Dawn

Atria Dawn Preview описывается разработчиками как агентная языковая модель на архитектуре mixture-of-experts с 744 млрд параметров. Она рассчитана на исследовательские и инженерные задачи, выполняемые в среде с доступом к инструментам, тестам, метрикам и внешним источникам.

Вместо оценки только итогового результата исследователи разобрали рабочий процесс: кто предлагал цель или метод, кто выбирал окончательный вариант, как устранялись затруднения и мог ли участник выполнить задачу без помощи ИИ. Такой подход позволяет отделить выполнение множества промежуточных операций от решений, меняющих направление проекта.

Команда связана с Fudan University, однако предоставленный материал не содержит ссылки на первичную публикацию с полной методологией и наборами данных. Поэтому приведенные показатели следует рассматривать как результаты, заявленные авторами проекта и пересказанные вторичным источником, а не как независимо воспроизведенную оценку.

Разработчики также утверждают, что Atria Dawn Preview лидирует в пяти из 16 использованных ими тестов, включая задания на веб-поиск и кибербезопасность. Вместе с тем общего превосходства над конкурирующими моделями команда не заявляет. Без первичных таблиц и условий запуска невозможно оценить сопоставимость этих результатов с публичными тестами других систем.

Больше действий агента не означает больше полномочий

За четыре недели медианное соотношение действий агента к человеческим вводам выросло с 11 до 28,5. Иными словами, после одного обращения пользователя система стала выполнять более длинную последовательность промежуточных шагов.

Авторы предостерегают от трактовки этой динамики как роста самостоятельности. Один человек мог принять ключевое решение, после чего агент десятки раз вызывал инструменты, проверял результат и исправлял ошибки. Счетчик операций в таком случае рос, хотя контроль над целью и методом не переходил к системе.

Наиболее распространенной схемой при выборе методов и параметров стала модель «ИИ предлагает, человек выбирает» — на нее пришлось 55,4% соответствующих случаев. Люди приняли 85,5% окончательных решений в этой категории, а ИИ — 9,2%. Из доступного пересказа неясно, как классифицировалась оставшаяся доля, поэтому складывать эти показатели в полное распределение без первичной методологии нельзя.

Еще сильнее человеческий контроль проявлялся при определении целей и объема работы: финальное решение оставалось за участником в 93,4% случаев. В зависимости от категории ИИ генерировал от 17% до 55% предложений, однако его доля окончательных решений сохранялась на однозначном уровне.

Треть задач участники не стали бы выполнять без ИИ

Исследователи отдельно спросили участников, смогли бы они выполнить свою часть работы без ИИ с тем же объемом и качеством. Из 455 завершенных задач с поддержкой агентов 151 задачу — около трети — участники оценили как невыполнимую без такой помощи.

Эти ответы поступили от 27 из 56 участников. Следовательно, эффект не был сосредоточен у нескольких наиболее активных пользователей. Интерпретация авторов состоит в том, что агенты расширили набор практически доступных задач, а не просто ускорили уже привычную работу.

Этот вывод основан на самооценке участников, а не на контролируемом сравнении двух групп, выполнявших одинаковые задания с ИИ и без него. Он показывает, как сами разработчики воспринимали вклад агентов, однако не позволяет точно измерить прирост производительности или доказать объективную невозможность выполнения задач вручную.

Даже в группе из 151 условно невыполнимой без ИИ задачи люди определяли цель в 95,4% случаев. Получается, что агент мог сделать проект технически осуществимым, не становясь автором его направления.

При сбоях человек менял контекст, а агент продолжал работу

Для 588 задач исследователи зафиксировали возникшие сложности. В 76% таких случаев работа продолжилась после вмешательства человека, тогда как агент самостоятельно справился с проблемой в 23% случаев.

Помощь обычно заключалась не в ручном выполнении задачи. В 35,2% случаев человек добавлял контекст или уточнял требования, еще в 34,7% — диагностировал проблему и менял метод. На частичное ручное редактирование пришлось 3,2%, а на полный перехват работы — 0,7%.

После получения обратной связи агенты самостоятельно вносили необходимые изменения в 75,4% случаев. Эти данные указывают на разделение ролей: система берет на себя исполнение и повторные итерации, а человек обнаруживает неверное направление, дополняет недостающую информацию и решает, когда следует сменить подход.

Такой процесс может выглядеть автономным по числу операций. Фактически его устойчивость зависит от способности человека сформулировать проблему и оценить результат. Автоматизируется значительная часть исполнения, тогда как экспертное суждение остается критической точкой.

Что проверять командам, внедряющим агентов

Главный практический вывод исследования — не использовать количество вызовов модели или длительность автономного запуска как показатель реальной самостоятельности. Командам полезнее отдельно фиксировать три уровня участия:

Кто определил цель и критерии успешного результата.

Кто предложил и утвердил метод выполнения.
3. Кто проверил итог и имел возможность остановить процесс.

Если агент совершает сотни действий после одного человеческого решения, это говорит о масштабе делегированного исполнения, а не обязательно о передаче управленческих полномочий. Для аудита также стоит сохранять причины смены метода, результаты тестов и точки, в которых человек одобрил продолжение работы.

Полезным внешним ориентиром для организации такого контроля может служить AI Risk Management Framework Национального института стандартов и технологий США. Этот документ не подтверждает результаты Atria Dawn, однако предлагает разделять управление рисками, измерение характеристик системы и постоянный мониторинг — вместо оценки автоматизации по одному показателю активности.

Пока первичная работа и полные журналы Atria Dawn не доступны в представленном пакете, нельзя проверить выборку, правила разметки решений и заявленные результаты модели на бенчмарках. Наиболее надежный вывод из опубликованных цифр уже уже: ИИ-агенты способны резко увеличить объем выполняемой работы и сделать доступными новые задачи, при этом рост числа их действий сам по себе не доказывает рост автономности.

Источники