Запись архива

AgentMemBench: бенчмарк долгосрочной памяти агентов — внешнее хранилище обходит конкурентов

Новый препринт AgentMemBench сравнивает пять стратегий долгосрочной памяти для разговорных агентов на едином харнесе. Внешнее хранилище (EKV) лидирует по всем метрикам качества, но требует примерно на порядок больше токенов памяти.

Схематичное изображение долгосрочной памяти ИИ-агента
Схематичное изображение долгосрочной памяти ИИ-агента
David Pham.jpg | by Photos by flipchip / LasVegasVegas.com | wikimedia_commons | CC BY-SA 3.0

Суть

На arXiv опубликован препринт AgentMemBench (arXiv:2608.00009) — систематический бенчмарк стратегий долгосрочной памяти для разговорных агентов. В одинаковых условиях сравниваются пять подходов: окно контекста (ICW), внешнее ключ-значение хранилище (EKV), графовая эпизодическая память (GEM), компрессия через саммаризацию (CBS) и веб-дополненная память (WAM). Оценка — на трёх публичных датасетах (LoCoMo, MultiDoc2Dial, MSC) по 491 размеченному вопросу; генерация и судейство — Qwen2.5-7B-Instruct (4-bit) с жадным декодированием.

Ключевые цифры

Punkt | Detail
— | —
Лидер по качеству | EKV: макро Recall@5 0.792, MRR 0.677, Answer F1 0.156, Faithfulness 0.354
Дальний горизонт | На LoCoMo ICW, WAM, GEM и CBS дают Recall@5 <= 0.005; EKV — 0.573
Ближайший преследователь | CBS на извлечении — 0.556
Цена преимущества | EKV занимает ~5100 токенов против ~300 у ICW/WAM: точность против эффективности

Контекст и ограничения

Работа примечательна редкой для этой темы «честной» постановкой: пять семейств памяти на одном харнесе, одних данных и одной модели. Практический вывод — окна, саммари и графы сущностей разрушаются на длинных горизонтах, а плотный поиск масштабируется. Авторы также прогнали через тот же харнесс MemGPT/Letta и HippoRAG и выложили код и артефакты. Ограничения: одна модель (и та в 4-bit), 491 вопрос, а равенство WAM и ICW на внутренних данных заложено конструкцией — у веб-памяти нет in-corpus provenance. На других моделях соотношение сил может измениться.

Что проверять дальше

Стоит изучить репозиторий: как именно определяется «память» для каждой стратегии, как считается следовой объём и насколько строго разделены подходы. Интересно также, сохраняются ли выводы на более сильных моделях и в реальных продуктивных нагрузках.

Источники: оригинал — https://arxiv.org/abs/2608.00009; проверка статуса препринта — https://arxiv.org/