
Исследователи из IBM Research совместно с Hugging Face опубликовали результаты экспериментов, в которых попытались ответить на практический вопрос: сколько «памяти» нужно дать ИИ-агенту, чтобы он работал лучше, и работает ли принцип «чем больше, тем лучше»? Ответ оказался неочевидным.
В центре работы — метод ALTK-Evolve. Он позволяет агенту учиться на собственных прошлых траекториях: система извлекает из удачных и неудачных попыток выполнения задач поведенческие правила (guidelines), консолидирует их в набор и повторно инжектирует на этапе инференса. Никакого обновления весов модели или ручной разметки не требуется. Это делает метод дешёвым и переносимым между разными моделями.
Эксперименты проводились на бенчмарке AppWorld — 585 многошаговых задач (168 test_normal и 417 test_challenge) в девяти симулированных приложениях: календарях, мессенджерах, платёжных системах и других. Оценивались два показателя: TGC (Task Goal Completion) — полное выполнение задачи, и более строгий SGC (Scenario Goal Completion) — прохождение всех вариантов сценария.
Главный вывод: агентская память — это не функция, которую можно просто включить. Это доза, которую нужно калибровать под конкретную модель.
Три паттерна поведения моделей
Исследователи протестировали восемь моделей разного уровня — от 30B плотных до frontier-проприетарных систем — и выделили три повторяющихся паттерна.
Сильные модели с запасом производительности (например, DeepSeek-V3.2, 671B MoE) показывают наилучший результат, когда получают полный набор правил, включая редкие и граничные случаи. У DeepSeek TGC вырос на +9,5 процентных пункта, а SGC — на +16,1 п.п.
Более слабые или компактные модели, напротив, «тонут» в большом наборе правил. Для них оптимальным оказывается компактное ядро из высоконадёжных правил плюс несколько релевантных, извлечённых под конкретную задачу. gpt-oss-120b (117B MoE) с таким выборочным подходом получил +16,1 п.п. TGC, тогда как полный набор дал меньший прирост при росте затрат токенов на ~50%.
Уже насыщенные модели — те, что и так близки к потолку на данных задачах — не показывают измеримого улучшения. В экспериментах к таким отнесли GLM-5 (745B MoE). Исследователи подчёркивают: это наблюдение, а не доказанная причина — модель могла быть на пределе возможностей, правила могли не затрагивать её оставшиеся ошибки, или она могла неэффективно применять инструкции.
Ключевые факты
| Параметр | Значение |
|---|---|
| Метод | ALTK-Evolve: извлечение правил из траекторий агента, инжекция на инференсе, без обновления весов |
| Бенчмарк | AppWorld: 585 задач, 9 симулированных приложений |
| Модели | 8 моделей: от 30B до 745B, включая проприетарные |
| Лучший результат | gpt-oss-120b: +16,1 п.п. TGC при росте токенов всего на +5% (выборочная выдача правил) |
Что это значит для разработчиков агентов
Практический вывод работы очевиден: нельзя полагаться на универсальное решение. Для каждой модели нужно подбирать свой способ подачи «памяти» — и это можно делать автоматически, без дообучения. Более того, выборочная выдача правил оказалась не только точнее, но и дешевле: для gpt-oss-120b прирост производительности обошёлся всего в +5% токенов, а полный набор правил для DeepSeek остаётся доступным благодаря кешированию промптов в продакшене.
Важно и то, что «память» не удлиняет цикл рассуждений агента. DeepSeek выполнял примерно одинаковое количество шагов ReAct с памятью и без неё (около 18-19), так что дополнительные затраты связаны только с раздуванием входных токенов, а не с более долгими траекториями.
Для читателей Comrad404, которые строят или настраивают агентов, это исследование — прямой сигнал: при добавлении «памяти» своему агенту стоит сначала проверить, как модель реагирует на разный объём правил, и не пытаться скормить ей всё сразу. Экономия токенов и прирост точности могут идти рука об руку.
Источник: Hugging Face Blog — How Much Memory Does Your Agent Actually Need? (https://huggingface.co/blog/ibm-research/altk-evolve-hmm)
