
Что произошло
В arXiv появился препринт 2608.06417 (cs.LG), авторы которого сводят проверку фактов к геометрической задаче. Метод LaFaCt строит «направление ложности» в residual stream трансформера: на контрастных парах правдивых и ложных утверждений вычисляется разница средних активаций (принцип Contrastive Activation Addition). На инференсе last-token активация проверяемого утверждения проецируется на это направление, а проекция подаётся в MLP-классификатор. Ни дообучения базовой модели, ни внешнего поиска источников не требуется.
Почему обсуждают
Работа проверяет гипотезу о том, что истинность — структурированное, линейно отделимое свойство пространства представлений LLM, а не только финальный ответ модели. Если направление ложности устойчиво, детектор дезинформации можно строить почти без разметки и вычислений, что выглядит практичной альтернативой retrieval-системам.
Что подтверждено
Авторы сообщают о тестах на 11 моделях Gemma, Llama и Qwen (от 270M до 12B параметров). На бенчмарках LIAR и FACTors проекция last-token не уступает нуль- и малошотовому промптингу, наибольший прирост — у малых моделей. На AVeriTeC результаты слабее: разметка там привязана к подтверждающим источникам, что усложняет прямую оценку. Это препринт без полного рецензирования; код открыт в репозитории Malta-Lab/LaFaCt.
На что смотреть дальше
Открытыми остаются устойчивость направления при смене домена и зависимость от качества контрастных пар. Стоит следить за воспроизведением на других архитектурах, проверками на сдвинутых данных и обновлениями репозитория.
| Punkt | Detail |
|---|---|
| Метод | CAA-направление + MLP на last-token проекции |
| Модели | Gemma, Llama, Qwen: 11 шт., 270M–12B |
| Бенчмарки | AVeriTeC, LIAR, FACTors |
| Состояние | Препринт, код открыт, рецензия не пройдена |
Оригинал: https://arxiv.org/abs/2608.06417. Проверочный ориентир: https://github.blog/ (обновления по коду LaFaCt).
