
Специалисты Google Research Нитай Кальдерон и Галь Йона опубликовали исследование, посвященное проблеме параметрической фактуальности в больших языковых моделях. Авторы задались вопросом: когда современная LLM ошибается в фактах, происходит ли это из-за того, что модель никогда не закладывала информацию в параметры, или из-за неспособности извлечь уже имеющиеся данные? Предложенный исследователями фреймворк knowledge profiling показывает, что актуальные фронтирные модели успешно кодируют практически весь объем информации, но испытывают системные трудности с ее извлечением.
Для детального анализа ученые разработали бенчмарк WikiProfile, включающий 2150 верифицированных фактов из Википедии. Каждая запись сопровождается десятью специализированными заданиями, которые проверяют кодирование, прямое и обратное извлечение, а также узнавание. На основе этих тестов исследователи классифицировали состояние каждого факта по пяти категориям, разделив случаи отсутствия знаний на физическом уровне от сбоев в механизмах поиска ответов внутри самой архитектуры моделей.
Por que importa
В ходе масштабного тестирования 13 языковых моделей, включая решения семейств Gemini и GPT-5, было обработано около 4,5 миллиона ответов. Результаты зафиксировали, что на уровне кодирования информации передовые системы достигают насыщения. Для моделей вроде Gemini-3-Pro и GPT-5 показатель успешного кодирования фактов составляет от 95% до 98%. Тем не менее, даже при столь высоком уровне фиксации данных в параметрах, модели не могут напрямую извлечь от 26% до 34% фактов.
Ключевые факты
Метрика | Значение | Описание
Объем бенчмарка | 2150 фактов | Выборка структурированных данных из Википедии с набором тестов
Кодирование в топ-моделях | 95–98% | Доля фактов, успешно сохраненных в параметрах Gemini-3-Pro и GPT-5
Ошибки прямого извлечения | 26–34% | Доля закодированных фактов, которые модели не могут воспроизвести напрямую
Остаточные сбои с Thinking | 11–12% | Доля ошибок, сохраняющихся даже при использовании цепочки рассуждений
Применение механизмов цепочки рассуждений и специализированных режимов обдумывания заметно улучшает показатели, однако полностью проблему не решает. Даже с задействованием расширенного вывода на этапе инференса фронтирные модели допускают ошибки при извлечении 11–12% фактов. Это подтверждает, что при масштабировании систем фокус инженерных задач смещается от наращивания базы знаний к оптимизации доступа к уже имеющейся информации.
Авторы работы также исследовали влияние популярности данных на качество работы моделей. Вопреки распространенному мнению о том, что редкие факты хуже усваиваются из-за нехватки емкости сети, анализ показал сопоставимый уровень кодирования для низкопопулярных и высокопопулярных сущностей. Главный разрыв возникает именно на этапе формулирования запросов, когда контекст или формулировка отклоняются от условий, в которых модель изначально обучалась.
Полученные выводы имеют важное значение для разработчиков, проектирующих архитектуры агентных систем и пайплайны пост-тренинга. Борьба с галлюцинациями и фактическими ошибками требует не только расширения обучающих датасетов, но и внедрения методов инференса, которые помогают модели эффективно использовать внутреннюю память.
Источник: Google Research Blog, https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/
Datos clave
| Punto | Detalle |
|---|---|
| Fuente | Google Research Blog |
| Fecha | 2026-08-12T09:51:00+00:00 |
| Tema | Empty shelves or lost keys? Recall is the bottleneck for parametric factuality |