
Исследователи опубликовали работу «On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents», в которой выясняли, способны ли небольшие языковые модели работать как агенты, строго соблюдая выделенное им реальное время и одновременно повышая за его счёт качество решения. Эксперименты проводились на моделях Qwen3.6-27B и Qwen3-4B, а в качестве полигонов взяли два агентных бенчмарка: MLE-Bench Lite и текстовый квест Zork I из среды Jericho.
Проблема контроля времени у агентов на практике
LLM-агенты обычно не имеют встроенных механизмов слежения за реальным временем выполнения. Если просто указать в промпте величину бюджета, модели Qwen оказываются неспособны перевести эту цифру в осмысленную стратегию. Причины: отсутствие обратной связи о реальном времени со стороны исполняющей среды, неумение предсказывать длительность собственных действий и отсутствие выученного сопоставления «доступное время — подходящая тактика».
Такая ситуация знакома любому, кто пробовал встраивать LLM в процессы с жёсткими дедлайнами: агент может как преждевременно остановиться, так и бесконечно петлять, не реагируя на временные рамки.
Экспериментальные домены: MLE-Bench Lite и Zork I
Для проверки выбрали задачи, где дополнительные вычисления способны объективно улучшить результат. MLE-Bench Lite включает соревнования по машинному обучению, в которых агенту нужно предложить решение за ограниченное время. Zork I — интерактивная текстовая игра с исследованием и решением головоломок, где глубокое планирование даёт реальный выигрыш.
В простейшей постановке — бюджет только в промпте, без дополнительной информации — агенты не умеют контролировать расход времени ни в одном из окружений.
Два подхода к решению: «железные» механизмы и обучение с подкреплением
Авторы проверили два класса вмешательств. Первый — модификации среды исполнения (harness): на каждом шаге агенту сообщается оставшееся время, а при превышении лимита среда принудительно завершает работу. Такие «железные» механизмы существенно улучшили соблюдение бюджета у Qwen3.6-27B без падения качества выполнения задач. Жёсткие хуки показали ещё более строгое следование лимитам.
Второй подход — обучение с подкреплением (GRPO) с наградой за соблюдение бюджета. На Zork I RL удалось достичь почти идеального соблюдения бюджета, причём агент обобщал поведение на бюджеты, не показывавшиеся при обучении. На MLE-Bench прирост производительности задач по сравнению с нетренированным агентом, уже получившим «железный» контроль времени, оказался нулевым.
Ключевое наблюдение: продуктивность не равна пунктуальности
Даже когда агенты научились укладываться в срок, использовать дополнительное время с пользой они не смогли. Политики, обученные через GRPO, останавливаются вовремя, но часто заполняют оставшиеся секунды повторяющимися действиями без реального вклада в решение. Обучение на нескольких длительностях бюджета приводит к «схлопыванию» стратегии к самому короткому варианту — модель ведёт себя так, будто времени всегда минимально, игнорируя реальный запас.
Это демонстрирует разрыв между соблюдением временных ограничений и продуктивным распределением времени, и авторы прямо называют его центральной проблемой для агентов, действующих в условиях бюджета.
Практический вывод
Работа чётко показывает: грубый контроль времени через среду — работающий и простой способ заставить LLM-агента соблюдать дедлайны, но он не делает агента умнее в планировании затрат. Обучение с подкреплением закрывает вопрос соблюдения бюджета, однако задача научить модель извлекать выгоду из выделенных секунд остаётся открытой. Для разработчиков автономных агентов это означает, что одного «таймера» недостаточно — нужны механизмы, поощряющие осмысленное использование времени, а не имитацию активности.
Источники
- On the Clock: Towards Punctual and Productive Time-Budgeted AI Agents — arXiv:2610.10833 (https://arxiv.org/abs/2610.10833), опубликовано 9 октября 2026.










