Запись архива

Память LLM-агентам нужна, но не любая: MERIT оценивает цену и пользу

Исследователи представили MERIT — бенчмарк для измерения предельной полезности долговременной памяти у LLM-агентов, выполняющих инструментальные задачи. Результаты показывают, что память повышает успешность с 0 до 0.55–1.0, но её реализация критична: обновление фактов ломает эмбеддинговый поиск, а полный повтор истории

Сравнение эффективности различных реализаций памяти LLM-агентов в бенчмарке MERIT
Сравнение эффективности различных реализаций памяти LLM-агентов в бенчмарке MERIT
Kurdish people protest against the Turkiish government at Hay Hill, Norwich | by Roger Blackwell | openverse | by

На arxiv опубликована работа «When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents», в которой представлен MERIT (Memory Evaluation for Realistic Instrumented Tasks) — новый бенчмарк и среда для оценки долговременной памяти у LLM-агентов, выполняющих задачи с использованием инструментов.

Проблема и подход

Существующие бенчмарки (LoCoMo, LongMemEval) измеряют память через ответы на вопросы по диалоговой истории, но не проверяют, влияет ли запомненная информация на реальные действия агента. MERIT устраняет этот разрыв: он оценивает предельную полезность памяти для агентов, выполняющих эпизодические задачи с инструментами, и ведёт полный учёт затрат (токены и доллары на каждую операцию с памятью).

Архитектура бенчмарка

MERIT включает три домена задач, зависимость от фактов из предыдущих эпизодов верифицируется автоматической проверкой утечек. Бенчмарк предлагает лестницу сложности, завершающуюся recall-тестами на обновлённые факты, контролируемое повреждение памяти и полный учёт токенов и стоимости.

Экспериментальные результаты

В пилотном запуске на 23 440 оценённых эпизодах (общая стоимость $42.57) использовались GPT-4.1-mini, а затем предрегистрированная сетка 3 модели × 3 seed (GPT-4.1, Claude Haiku 4.5). Ключевые результаты:

  • Память поднимает успешность зависимых задач с верифицированного нуля до 0.55–1.00.
  • На обновлённых фактах эмбеддинговый поиск демонстрирует непредсказуемое падение (0.30–0.95, разброс между seed до 0.45).
  • Агенты действуют на основе корректно извлечённого значения только в 55% случаев.
  • Хранилища с обновлением при записи (структурированное хранилище фактов и LLM-суммаризация) остаются в диапазоне 0.70–1.00.
  • Гибридная память (эмбеддинги + структурированное хранилище) показывает результат хуже, чем одно только структурированное хранилище.
  • Замена реализации памяти меняет успешность задачи до 60 процентных пунктов.
  • Полный повтор истории никогда не экономичен: лучший режим на домен даёт 2.7–3.9x предельной полезности на доллар.

Проверка на актуальных моделях

Спот-чек на Claude Sonnet 5 (с контролем чистого полного повтора) воспроизводит выявленные закономерности: эмбеддинговая память остаётся уязвимой к обновлениям фактов, а структурированные хранилища сохраняют надёжность.

Практические выводы

Для разработчиков LLM-агентов результаты MERIT означают, что выбор реализации памяти — не техническая деталь, а ключевой фактор, определяющий как успешность, так и экономику системы. Эмбеддинговый поиск, популярный в RAG-системах, может быть ненадёжен для сценариев с обновлением фактов. Структурированные хранилища и LLM-суммаризация показывают лучшую устойчивость, но их стоимость и сложность интеграции требуют отдельного анализа.

Источники

  • Статья на arXiv: «When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents» (arXiv:2609.05441)
  • Репозиторий бенчмарка MERIT и все следы экспериментов