
Что произошло
Пользователь Reddit r/artificial поделился наблюдением: длинный безобидный текст без инструкций вызывает устойчивый сдвиг активаций в средних и поздних слоях LLM и, по его словам, отключает механизмы безопасности без явного adversarial-промптинга. Автор утверждает, что располагает метриками и воспроизводимыми тестами, но пока не опубликовал их.
Почему это обсуждают
Тема пересекается с вопросом о природе «мира» LLM. Автор ссылается на тезис Янна Лекуна: чтобы хорошо предсказывать текст, модель должна понимать реальность, стоящую за ним. Если сдвиг активаций реален, это может указывать на латентные «регионы», сформированные при обучении, и на переключение между ними контекстом в обход RLHF-ограничений.
Что подтверждено и что нет
Пока это единичное наблюдение без публичных метрик, кода и воспроизведения сторонними исследователями. Сам автор отмечает, что известные материалы Anthropic по интерпретируемости не описывают именно этот эффект. Подтверждённого статуса у явления нет, это гипотеза для проверки.
Что проверить дальше
Стоит следить за публикацией метрик и тестов автора, обсуждением в r/artificial и реакцией специалистов по интерпретируемости. Ориентир для проверки — открытые материалы Anthropic.
| Punkt | Detail |
|---|---|
| Платформа | Reddit, r/artificial |
| Автор | /u/Historical-Cod-2537 |
| Суть | Нейтральный текст без инструкций меняет активации и обходит защиту |
| Статус | Не подтверждено, требует воспроизведения |
| Ссылка | Оригинал в r/artificial |
Оригинальный пост: https://www.reddit.com/r/artificial/comments/1viz14o/a_question_about_large_language_models_llms_my/
Проверочный ориентир: https://www.anthropic.com/news