Запись архива

V-Steer: редактирование кэшированных значений для соблюдения иерархии инструкций в LLM

Новый метод V-Steer позволяет на этапе инференса восстанавливать приоритет системных промптов над пользовательскими, редактируя кэшированные векторы значений. Точность соблюдения первичных ограничений вырастает с 18% до 92% без дополнительного обучения.

Диаграмма работы V-Steer: редактирование кэшированных V-тензоров для восстановления приоритета инструкций
Диаграмма работы V-Steer: редактирование кэшированных V-тензоров для восстановления приоритета инструкций
Student Studying in ACES Library (11056201595).jpg | by University of Illinois Library | wikimedia_commons | CC BY 2.0

Что произошло

На arXiv опубликована статья «Steering Instruction Hierarchies at Inference Time», в которой представлен метод V-Steer. Он решает известную проблему: современные LLM часто нарушают иерархию инструкций — системные промпты (высший приоритет) могут быть переопределены пользовательскими запросами. V-Steer работает без дообучения, только на этапе инференса, редактируя кэшированные векторы значений (value vectors) в self-attention.

Почему это обсуждают

Проблема иерархии инструкций напрямую связана с безопасностью развёртывания LLM: если злоумышленник может переписать системные ограничения через user prompt, профильтровать вывод становится сложнее. V-Steer предлагает лёгкое, не требующее повторного обучения решение, которое можно применить к уже развёрнутым моделям. Результаты на бенчмарках впечатляют: точность соблюдения первичных ограничений (primary constraint accuracy) поднимается с менее чем 18% до 92% на контролируемых тестах ролевых конфликтов. На более широких наборах метод превосходит prompt-only baseline и на 3 из 4 масштабов моделей (7B–70B) достигает или превосходит SOTA-методы, основанные на обучении.

Что подтверждено и что остаётся неясным

Авторы опубликовали код на GitHub (ссылка в статье). Метод совместим с fused attention backends и добавляет только одноразовый overhead на этапе prefill, что не замедляет декодинг. Однако работа основана на предположении, что первые токены предсказания дают достаточную информацию для идентификации голов внимания, в которых доминируют инструкции низкого приоритета. Возможна ли адаптация к более сложным, многоходовым атакам — пока не тестировалось. Кроме того, метод полагается на редактирование кэша, что может быть несовместимо с некоторыми архитектурами или реализациями.

Что проверять дальше

Стоит проверить, как V-Steer ведёт себя на новых моделях (например, Llama 3, Claude 4) и в реальных сценариях с длинными контекстами. Также интересно, можно ли комбинировать метод с другими инференс-тайм техниками (например, активационными патчами) и не возникнет ли конфликтов. Код на GitHub позволяет провести собственные эксперименты.

Punkt Detail
Название метода V-Steer
Тип Training-free inference time
Цель Восстановление иерархии инструкций в LLM
Основная метрика Primary constraint accuracy: <18% → 92%
Модели 7B–70B (Llama, Qwen, Mistral)
Overhead Только prefill, без замедления декодинга
Код github.com/cindy2000sh/v-steer

Источники: оригинальная статья arXiv:2607.26228 (https://arxiv.org/abs/2607.26228), код на GitHub (https://github.com/cindy2000sh/v-steer). Верификация дополнительных деталей — через блог GitHub (https://github.blog/).