
Суть
На arXiv опубликован препринт AgentMemBench (arXiv:2608.00009) — систематический бенчмарк стратегий долгосрочной памяти для разговорных агентов. В одинаковых условиях сравниваются пять подходов: окно контекста (ICW), внешнее ключ-значение хранилище (EKV), графовая эпизодическая память (GEM), компрессия через саммаризацию (CBS) и веб-дополненная память (WAM). Оценка — на трёх публичных датасетах (LoCoMo, MultiDoc2Dial, MSC) по 491 размеченному вопросу; генерация и судейство — Qwen2.5-7B-Instruct (4-bit) с жадным декодированием.
Ключевые цифры
Punkt | Detail
— | —
Лидер по качеству | EKV: макро Recall@5 0.792, MRR 0.677, Answer F1 0.156, Faithfulness 0.354
Дальний горизонт | На LoCoMo ICW, WAM, GEM и CBS дают Recall@5 <= 0.005; EKV — 0.573
Ближайший преследователь | CBS на извлечении — 0.556
Цена преимущества | EKV занимает ~5100 токенов против ~300 у ICW/WAM: точность против эффективности
Контекст и ограничения
Работа примечательна редкой для этой темы «честной» постановкой: пять семейств памяти на одном харнесе, одних данных и одной модели. Практический вывод — окна, саммари и графы сущностей разрушаются на длинных горизонтах, а плотный поиск масштабируется. Авторы также прогнали через тот же харнесс MemGPT/Letta и HippoRAG и выложили код и артефакты. Ограничения: одна модель (и та в 4-bit), 491 вопрос, а равенство WAM и ICW на внутренних данных заложено конструкцией — у веб-памяти нет in-corpus provenance. На других моделях соотношение сил может измениться.
Что проверять дальше
Стоит изучить репозиторий: как именно определяется «память» для каждой стратегии, как считается следовой объём и насколько строго разделены подходы. Интересно также, сохраняются ли выводы на более сильных моделях и в реальных продуктивных нагрузках.
Источники: оригинал — https://arxiv.org/abs/2608.00009; проверка статуса препринта — https://arxiv.org/