
На arxiv опубликована работа «When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents», в которой представлен MERIT (Memory Evaluation for Realistic Instrumented Tasks) — новый бенчмарк и среда для оценки долговременной памяти у LLM-агентов, выполняющих задачи с использованием инструментов.
Проблема и подход
Существующие бенчмарки (LoCoMo, LongMemEval) измеряют память через ответы на вопросы по диалоговой истории, но не проверяют, влияет ли запомненная информация на реальные действия агента. MERIT устраняет этот разрыв: он оценивает предельную полезность памяти для агентов, выполняющих эпизодические задачи с инструментами, и ведёт полный учёт затрат (токены и доллары на каждую операцию с памятью).
Архитектура бенчмарка
MERIT включает три домена задач, зависимость от фактов из предыдущих эпизодов верифицируется автоматической проверкой утечек. Бенчмарк предлагает лестницу сложности, завершающуюся recall-тестами на обновлённые факты, контролируемое повреждение памяти и полный учёт токенов и стоимости.
Экспериментальные результаты
В пилотном запуске на 23 440 оценённых эпизодах (общая стоимость $42.57) использовались GPT-4.1-mini, а затем предрегистрированная сетка 3 модели × 3 seed (GPT-4.1, Claude Haiku 4.5). Ключевые результаты:
- Память поднимает успешность зависимых задач с верифицированного нуля до 0.55–1.00.
- На обновлённых фактах эмбеддинговый поиск демонстрирует непредсказуемое падение (0.30–0.95, разброс между seed до 0.45).
- Агенты действуют на основе корректно извлечённого значения только в 55% случаев.
- Хранилища с обновлением при записи (структурированное хранилище фактов и LLM-суммаризация) остаются в диапазоне 0.70–1.00.
- Гибридная память (эмбеддинги + структурированное хранилище) показывает результат хуже, чем одно только структурированное хранилище.
- Замена реализации памяти меняет успешность задачи до 60 процентных пунктов.
- Полный повтор истории никогда не экономичен: лучший режим на домен даёт 2.7–3.9x предельной полезности на доллар.
Проверка на актуальных моделях
Спот-чек на Claude Sonnet 5 (с контролем чистого полного повтора) воспроизводит выявленные закономерности: эмбеддинговая память остаётся уязвимой к обновлениям фактов, а структурированные хранилища сохраняют надёжность.
Практические выводы
Для разработчиков LLM-агентов результаты MERIT означают, что выбор реализации памяти — не техническая деталь, а ключевой фактор, определяющий как успешность, так и экономику системы. Эмбеддинговый поиск, популярный в RAG-системах, может быть ненадёжен для сценариев с обновлением фактов. Структурированные хранилища и LLM-суммаризация показывают лучшую устойчивость, но их стоимость и сложность интеграции требуют отдельного анализа.
Источники
- Статья на arXiv: «When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents» (arXiv:2609.05441)
- Репозиторий бенчмарка MERIT и все следы экспериментов