Запись архива

Нейтральный текст без инструкций способен обходить защиту LLM — наблюдение с Reddit

Пользователь r/artificial описывает устойчивый сдвиг активаций в средних и поздних слоях LLM при подаче длинного безобидного текста без инструкций, который будто бы отключает RLHF-ограничения. Статус наблюдения пока не подтверждён.

Схема внутренних слоёв LLM и сдвига активаций
Схема внутренних слоёв LLM и сдвига активаций
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Что произошло

Пользователь Reddit r/artificial поделился наблюдением: длинный безобидный текст без инструкций вызывает устойчивый сдвиг активаций в средних и поздних слоях LLM и, по его словам, отключает механизмы безопасности без явного adversarial-промптинга. Автор утверждает, что располагает метриками и воспроизводимыми тестами, но пока не опубликовал их.

Почему это обсуждают

Тема пересекается с вопросом о природе «мира» LLM. Автор ссылается на тезис Янна Лекуна: чтобы хорошо предсказывать текст, модель должна понимать реальность, стоящую за ним. Если сдвиг активаций реален, это может указывать на латентные «регионы», сформированные при обучении, и на переключение между ними контекстом в обход RLHF-ограничений.

Что подтверждено и что нет

Пока это единичное наблюдение без публичных метрик, кода и воспроизведения сторонними исследователями. Сам автор отмечает, что известные материалы Anthropic по интерпретируемости не описывают именно этот эффект. Подтверждённого статуса у явления нет, это гипотеза для проверки.

Что проверить дальше

Стоит следить за публикацией метрик и тестов автора, обсуждением в r/artificial и реакцией специалистов по интерпретируемости. Ориентир для проверки — открытые материалы Anthropic.

Punkt Detail
Платформа Reddit, r/artificial
Автор /u/Historical-Cod-2537
Суть Нейтральный текст без инструкций меняет активации и обходит защиту
Статус Не подтверждено, требует воспроизведения
Ссылка Оригинал в r/artificial

Оригинальный пост: https://www.reddit.com/r/artificial/comments/1viz14o/a_question_about_large_language_models_llms_my/
Проверочный ориентир: https://www.anthropic.com/news