Запись архива

Латентная проверка фактов: ложь как направление в активациях LLM

arXiv-препринт LaFaCt: направление «ложности» в residual stream трансформера ловит дезинформацию без дообучения и внешних баз. Результаты на LIAR и FACTors — на уровне промптинга, на AVeriTeC — скромнее.

Векторное пространство представлений языковой модели
Векторное пространство представлений языковой модели
Physical Therapy Teaching Lab at CU Anschutz (October 2025).jpg | by Mikepascoe | wikimedia_commons | CC0

Что произошло
В arXiv появился препринт 2608.06417 (cs.LG), авторы которого сводят проверку фактов к геометрической задаче. Метод LaFaCt строит «направление ложности» в residual stream трансформера: на контрастных парах правдивых и ложных утверждений вычисляется разница средних активаций (принцип Contrastive Activation Addition). На инференсе last-token активация проверяемого утверждения проецируется на это направление, а проекция подаётся в MLP-классификатор. Ни дообучения базовой модели, ни внешнего поиска источников не требуется.

Почему обсуждают
Работа проверяет гипотезу о том, что истинность — структурированное, линейно отделимое свойство пространства представлений LLM, а не только финальный ответ модели. Если направление ложности устойчиво, детектор дезинформации можно строить почти без разметки и вычислений, что выглядит практичной альтернативой retrieval-системам.

Что подтверждено
Авторы сообщают о тестах на 11 моделях Gemma, Llama и Qwen (от 270M до 12B параметров). На бенчмарках LIAR и FACTors проекция last-token не уступает нуль- и малошотовому промптингу, наибольший прирост — у малых моделей. На AVeriTeC результаты слабее: разметка там привязана к подтверждающим источникам, что усложняет прямую оценку. Это препринт без полного рецензирования; код открыт в репозитории Malta-Lab/LaFaCt.

На что смотреть дальше
Открытыми остаются устойчивость направления при смене домена и зависимость от качества контрастных пар. Стоит следить за воспроизведением на других архитектурах, проверками на сдвинутых данных и обновлениями репозитория.

Punkt Detail
Метод CAA-направление + MLP на last-token проекции
Модели Gemma, Llama, Qwen: 11 шт., 270M–12B
Бенчмарки AVeriTeC, LIAR, FACTors
Состояние Препринт, код открыт, рецензия не пройдена

Оригинал: https://arxiv.org/abs/2608.06417. Проверочный ориентир: https://github.blog/ (обновления по коду LaFaCt).