SAGA: агенты учатся превращать опыт в переносимые принципы

Исследователи представили SAGA — архитектуру памяти для LLM-агентов, которая преобразует отдельные взаимодействия в процедуры и принципы с условиями применимости.

Схема SAGA: LLM-агент преобразует опыт взаимодействия в процедуры и принципы
Схема SAGA: LLM-агент преобразует опыт взаимодействия в процедуры и принципы
Hierarchical structure of EOLSS.jpg | by Arjmsst | wikimedia_commons | CC BY-SA 4.0

Исследователи представили SAGA — Self-evolving Agents through Experience-Grounded Abstraction, фреймворк для саморазвития LLM-агентов без изменения параметров базовой модели. Работа опубликована на arXiv под номером 2610.06964.

Главная идея

Вместо простого накопления историй агент преобразует траектории взаимодействия в знания нескольких уровней: описания эпизодов, повторно используемые процедуры и более общие принципы. Для каждого принципа авторы предлагают сохранять условия применимости и связь с исходными действиями. Это должно помочь отличать полезное обобщение от совета, вырванного из контекста.

Такой подход адресует ограничение внешней памяти: записи о прошлых задачах могут быть слишком тесно связаны с конкретным окружением. По замыслу SAGA, агент извлекает принцип, адаптирует его под текущую задачу, а затем использует как руководство для выбора действий.

Как работает цикл

Система формирует память постепенно. После взаимодействия с окружением она выделяет опыт и поднимает его на более абстрактный уровень. При следующем запросе подходящий принцип не применяется механически: он сначала «инстанцируется» под конкретную задачу. Затем агент уточняет кандидатов на действие с помощью корректирующей обратной связи и повторной выборки.

Получается замкнутый цикл: выполнение порождает новый опыт, опыт обновляет иерархическую память, а извлечённые знания влияют на будущие действия. Важная деталь — сохранение связей с доказательствами исполнения: принцип можно сопоставить с теми действиями, из которых он был выведен.

Что показали эксперименты

Авторы проверили SAGA в ScienceWorld и ALFWorld — средах для интерактивных задач. В статье сообщается об улучшении результатов выполнения задач. Абляционные эксперименты отдельно указывают на роль контекстной адаптации принципов и регулирования действий: одного хранения обобщённых правил недостаточно, если агент не умеет привязать их к текущей ситуации и использовать при выборе следующего шага.

Практическое значение и ограничения

Для разработчиков агентов SAGA интересна как схема памяти поверх закрытой или крупной LLM: базовую модель не требуется дообучать, а опыт можно накапливать во внешнем контуре. Потенциально это упрощает перенос рабочих процедур между похожими задачами и делает память более структурированной, чем архив необработанных диалогов.

Однако работа описывает исследовательский фреймворк, а не готовый компонент для production. Из приведённого описания нельзя сделать вывод о масштабировании на произвольные домены, стоимости хранения и извлечения памяти или устойчивости принципов к ошибкам исходного опыта. Качество системы также зависит от того, насколько корректно она обобщает траектории и определяет условия применимости. Поэтому SAGA стоит рассматривать как архитектурную гипотезу, подтверждённую экспериментами в двух тестовых средах, а не как универсальный способ обучения агентов.

Источники

Оригинальная статья: https://arxiv.org/abs/2610.06964
Проверка публикации: https://arxiv.org/