
Исследователь под псевдонимом rayanpal_ представил эксперимент, который наглядно демонстрирует фундаментальное различие между наличием у языковой модели правильного ответа и готовностью его выдать. Работа построена на модифицированной версии открытой модели Qwen3-4B, получившей название PCCG-2.
Как устроен «шлюз разрешения»
В стандартной архитектуре авторегрессионных LLM генерация текста начинается с выбора первого токена из распределения вероятностей, которое включает и стоп-токен (EOS — End of Sequence). Если стоп-токен получает наивысший балл на первом же шаге, модель завершает работу, не сгенерировав ни одного видимого символа.
Автор эксперимента добавил к замороженной (frozen) модели Qwen3-4B отдельный обучаемый модуль — шлюз разрешения, состоящий всего из 101 параметра. Этот шлюз не имеет доступа к тексту вопроса и не может изменять оценки (logits) содержательных токенов. Его единственная функция — модифицировать балл стоп-токена на основе отдельного шестизначного условия равенства.
Ключевые результаты эксперимента
Для вопроса «Сколько будет 2 + 2?» токен «4» стабильно получал оценку 53,0 во всех экспериментальных условиях, включая те случаи, когда модель не выдавала ответа. Полный вектор оценок первого токена, за исключением стоп-токена, оставался побайтово идентичным.
Когда условие на шлюзе проходило, модель генерировала «4» с последующим стоп-токеном. Когда условие не выполнялось, стоп-токен побеждал на первом же шаге, и ответ не появлялся.
Автор провёл перекрёстную проверку: в 40 из 40 случаев, когда модель должна была дать ответ, но срабатывал стоп-токен, после инвертирования состояния шлюза появлялся правильный ответ. И наоборот: в 40 случаях, когда модель отвечала, инвертирование заставляло её замолчать. Контрольные прогоны (80/80) остались без изменений.
Финальная валидация на 2048 контекстах с 75 различными идентичностями ответов показала 100% соответствие ожиданиям.
Практическое значение и ограничения
Эксперимент демонстрирует, что цензурирование или отказ от ответа могут происходить на уровне, который не затрагивает само знание модели. Модель «знает» правильный ответ на уровне токенных представлений, но механизм принятия решения о начале генерации может быть переопределён отдельным, крайне компактным модулем.
Автор отмечает, что это инженерный эксперимент на открытой модели, а не атака на коммерческие системы. Однако в сопроводительных материалах упоминается более раннее исследование «Cross-Vendor Semantic Void Matrix» (DOI), в котором документированы случаи нулевой видимой генерации у 11 LLM от OpenAI, Anthropic, Google и Moonshot.
Открытые материалы и воспроизводимость
Все компоненты эксперимента опубликованы:
— Веса модели и исходный код
— PDF-версия статьи с DOI
— Рукописное приложение и верификатор доказательств
— Сырая запись пяти экспериментальных групп
Ограничение подхода: эксперимент проведён на одной модели (Qwen3-4B) и демонстрирует принцип, а не универсальный механизм. Для практического применения в системах безопасности потребуется адаптация под разные архитектуры.
Источники
— Оригинальная публикация на Reddit: https://www.reddit.com/r/artificial/comments/1wetmka/it_knew_2_2_4_why_didnt_it_answer/
— Сайт для ознакомления с другими работами автора: https://getswiftapi.com
— Страница OpenAI с политикой безопасности: https://openai.com/news/
