Авторы Alina Shutova, Alexandra Olenina, Ivan Vinogradov и Anton Sinitsin в препринте версии v4 от 1 октября 2026 года предложили бенчмарк StructMemEval (arXiv:2602.11243). Он проверяет способность LLM-агентов организовывать долговременную память, а не просто вспоминать факты.
Существующие тесты долговременной памяти обычно измеряют удержание фактов, многошаговое вспоминание или учёт временны́х изменений. Такие задачи часто решаются простыми retrieval-дополненными языковыми моделями и не проверяют сложные иерархии памяти. StructMemEval фокусируется на структурах, которыми люди пользуются для организации знаний: журналы транзакций, списки дел, деревья и другие.
Начальные эксперименты авторов показали: простые retrieval-LLM с задачами бенчмарка не справляются, тогда как агенты, которым явно подсказали, как организовать память, решают их надёжно. При этом современные LLM без внешней подсказки часто не распознают структуру памяти самостоятельно. Авторы считают это важным направлением для совершенствования как обучения LLM, так и архитектур фреймворков памяти.
Бенчмарк представлен как work in progress. Полный текст, код и данные пока не опубликованы; независимые рецензии отсутствуют, поэтому приведённые выводы следует считать предварительными.







