На часах: смогут ли ИИ-агенты уложиться в отведённое время и не потерять в продуктивности

Исследователи проверили, как небольшие LLM-агенты работают с явным ограничением по времени, и выяснили, что соблюдать бюджет они могут, а вот использовать лишнее время с пользой — пока нет.

ИИ-агент с песочными часами — иллюстрация работы в условиях ограниченного бюджета времени.
ИИ-агент с песочными часами — иллюстрация работы в условиях ограниченного бюджета времени.
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Исследователи опубликовали работу «On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents», в которой выясняли, способны ли небольшие языковые модели работать как агенты, строго соблюдая выделенное им реальное время и одновременно повышая за его счёт качество решения. Эксперименты проводились на моделях Qwen3.6-27B и Qwen3-4B, а в качестве полигонов взяли два агентных бенчмарка: MLE-Bench Lite и текстовый квест Zork I из среды Jericho.

Проблема контроля времени у агентов на практике

LLM-агенты обычно не имеют встроенных механизмов слежения за реальным временем выполнения. Если просто указать в промпте величину бюджета, модели Qwen оказываются неспособны перевести эту цифру в осмысленную стратегию. Причины: отсутствие обратной связи о реальном времени со стороны исполняющей среды, неумение предсказывать длительность собственных действий и отсутствие выученного сопоставления «доступное время — подходящая тактика».

Такая ситуация знакома любому, кто пробовал встраивать LLM в процессы с жёсткими дедлайнами: агент может как преждевременно остановиться, так и бесконечно петлять, не реагируя на временные рамки.

Экспериментальные домены: MLE-Bench Lite и Zork I

Для проверки выбрали задачи, где дополнительные вычисления способны объективно улучшить результат. MLE-Bench Lite включает соревнования по машинному обучению, в которых агенту нужно предложить решение за ограниченное время. Zork I — интерактивная текстовая игра с исследованием и решением головоломок, где глубокое планирование даёт реальный выигрыш.

В простейшей постановке — бюджет только в промпте, без дополнительной информации — агенты не умеют контролировать расход времени ни в одном из окружений.

Два подхода к решению: «железные» механизмы и обучение с подкреплением

Авторы проверили два класса вмешательств. Первый — модификации среды исполнения (harness): на каждом шаге агенту сообщается оставшееся время, а при превышении лимита среда принудительно завершает работу. Такие «железные» механизмы существенно улучшили соблюдение бюджета у Qwen3.6-27B без падения качества выполнения задач. Жёсткие хуки показали ещё более строгое следование лимитам.

Второй подход — обучение с подкреплением (GRPO) с наградой за соблюдение бюджета. На Zork I RL удалось достичь почти идеального соблюдения бюджета, причём агент обобщал поведение на бюджеты, не показывавшиеся при обучении. На MLE-Bench прирост производительности задач по сравнению с нетренированным агентом, уже получившим «железный» контроль времени, оказался нулевым.

Ключевое наблюдение: продуктивность не равна пунктуальности

Даже когда агенты научились укладываться в срок, использовать дополнительное время с пользой они не смогли. Политики, обученные через GRPO, останавливаются вовремя, но часто заполняют оставшиеся секунды повторяющимися действиями без реального вклада в решение. Обучение на нескольких длительностях бюджета приводит к «схлопыванию» стратегии к самому короткому варианту — модель ведёт себя так, будто времени всегда минимально, игнорируя реальный запас.

Это демонстрирует разрыв между соблюдением временных ограничений и продуктивным распределением времени, и авторы прямо называют его центральной проблемой для агентов, действующих в условиях бюджета.

Практический вывод

Работа чётко показывает: грубый контроль времени через среду — работающий и простой способ заставить LLM-агента соблюдать дедлайны, но он не делает агента умнее в планировании затрат. Обучение с подкреплением закрывает вопрос соблюдения бюджета, однако задача научить модель извлекать выгоду из выделенных секунд остаётся открытой. Для разработчиков автономных агентов это означает, что одного «таймера» недостаточно — нужны механизмы, поощряющие осмысленное использование времени, а не имитацию активности.

Источники

  • On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents — arXiv:2610.10833 (https://arxiv.org/abs/2610.10833), опубликовано 9 октября 2026.