Нейтральный текст без инструкций способен обходить защиту LLM — наблюдение с Reddit
Пользователь r/artificial описывает устойчивый сдвиг активаций в средних и поздних слоях LLM при подаче длинного безобидного текста без инструкций, который будто бы отключает RLHF-ограничения....
Открыть материал →









