Запись архива

IBM и Hugging Face выяснили, сколько памяти на самом деле нужно ИИ-агенту

Исследователи IBM Research и Hugging Face представили ALTK-Evolve — метод, позволяющий агенту учиться на собственных прошлых действиях без обновления весов. Главный вывод: эффективность «памяти» зависит не от её объёма, а от дозировки под конкретную модель.

Диаграмма цикла ALTK-Evolve: агент выполняет задачи, из траекторий извлекаются правила поведения, которые затем подаются агенту при следующем запуске
Диаграмма цикла ALTK-Evolve: агент выполняет задачи, из траекторий извлекаются правила поведения, которые затем подаются агенту при следующем запуске
Imagen destacada del articulo fuente

Исследователи из IBM Research совместно с Hugging Face опубликовали результаты экспериментов, в которых попытались ответить на практический вопрос: сколько «памяти» нужно дать ИИ-агенту, чтобы он работал лучше, и работает ли принцип «чем больше, тем лучше»? Ответ оказался неочевидным.

В центре работы — метод ALTK-Evolve. Он позволяет агенту учиться на собственных прошлых траекториях: система извлекает из удачных и неудачных попыток выполнения задач поведенческие правила (guidelines), консолидирует их в набор и повторно инжектирует на этапе инференса. Никакого обновления весов модели или ручной разметки не требуется. Это делает метод дешёвым и переносимым между разными моделями.

Эксперименты проводились на бенчмарке AppWorld — 585 многошаговых задач (168 test_normal и 417 test_challenge) в девяти симулированных приложениях: календарях, мессенджерах, платёжных системах и других. Оценивались два показателя: TGC (Task Goal Completion) — полное выполнение задачи, и более строгий SGC (Scenario Goal Completion) — прохождение всех вариантов сценария.

Главный вывод: агентская память — это не функция, которую можно просто включить. Это доза, которую нужно калибровать под конкретную модель.

Три паттерна поведения моделей

Исследователи протестировали восемь моделей разного уровня — от 30B плотных до frontier-проприетарных систем — и выделили три повторяющихся паттерна.

Сильные модели с запасом производительности (например, DeepSeek-V3.2, 671B MoE) показывают наилучший результат, когда получают полный набор правил, включая редкие и граничные случаи. У DeepSeek TGC вырос на +9,5 процентных пункта, а SGC — на +16,1 п.п.

Более слабые или компактные модели, напротив, «тонут» в большом наборе правил. Для них оптимальным оказывается компактное ядро из высоконадёжных правил плюс несколько релевантных, извлечённых под конкретную задачу. gpt-oss-120b (117B MoE) с таким выборочным подходом получил +16,1 п.п. TGC, тогда как полный набор дал меньший прирост при росте затрат токенов на ~50%.

Уже насыщенные модели — те, что и так близки к потолку на данных задачах — не показывают измеримого улучшения. В экспериментах к таким отнесли GLM-5 (745B MoE). Исследователи подчёркивают: это наблюдение, а не доказанная причина — модель могла быть на пределе возможностей, правила могли не затрагивать её оставшиеся ошибки, или она могла неэффективно применять инструкции.

Ключевые факты

Параметр Значение
Метод ALTK-Evolve: извлечение правил из траекторий агента, инжекция на инференсе, без обновления весов
Бенчмарк AppWorld: 585 задач, 9 симулированных приложений
Модели 8 моделей: от 30B до 745B, включая проприетарные
Лучший результат gpt-oss-120b: +16,1 п.п. TGC при росте токенов всего на +5% (выборочная выдача правил)

Что это значит для разработчиков агентов

Практический вывод работы очевиден: нельзя полагаться на универсальное решение. Для каждой модели нужно подбирать свой способ подачи «памяти» — и это можно делать автоматически, без дообучения. Более того, выборочная выдача правил оказалась не только точнее, но и дешевле: для gpt-oss-120b прирост производительности обошёлся всего в +5% токенов, а полный набор правил для DeepSeek остаётся доступным благодаря кешированию промптов в продакшене.

Важно и то, что «память» не удлиняет цикл рассуждений агента. DeepSeek выполнял примерно одинаковое количество шагов ReAct с памятью и без неё (около 18-19), так что дополнительные затраты связаны только с раздуванием входных токенов, а не с более долгими траекториями.

Для читателей Comrad404, которые строят или настраивают агентов, это исследование — прямой сигнал: при добавлении «памяти» своему агенту стоит сначала проверить, как модель реагирует на разный объём правил, и не пытаться скормить ей всё сразу. Экономия токенов и прирост точности могут идти рука об руку.

Источник: Hugging Face Blog — How Much Memory Does Your Agent Actually Need? (https://huggingface.co/blog/ibm-research/altk-evolve-hmm)