
Что произошло
На arXiv опубликована статья «Steering Instruction Hierarchies at Inference Time», в которой представлен метод V-Steer. Он решает известную проблему: современные LLM часто нарушают иерархию инструкций — системные промпты (высший приоритет) могут быть переопределены пользовательскими запросами. V-Steer работает без дообучения, только на этапе инференса, редактируя кэшированные векторы значений (value vectors) в self-attention.
Почему это обсуждают
Проблема иерархии инструкций напрямую связана с безопасностью развёртывания LLM: если злоумышленник может переписать системные ограничения через user prompt, профильтровать вывод становится сложнее. V-Steer предлагает лёгкое, не требующее повторного обучения решение, которое можно применить к уже развёрнутым моделям. Результаты на бенчмарках впечатляют: точность соблюдения первичных ограничений (primary constraint accuracy) поднимается с менее чем 18% до 92% на контролируемых тестах ролевых конфликтов. На более широких наборах метод превосходит prompt-only baseline и на 3 из 4 масштабов моделей (7B–70B) достигает или превосходит SOTA-методы, основанные на обучении.
Что подтверждено и что остаётся неясным
Авторы опубликовали код на GitHub (ссылка в статье). Метод совместим с fused attention backends и добавляет только одноразовый overhead на этапе prefill, что не замедляет декодинг. Однако работа основана на предположении, что первые токены предсказания дают достаточную информацию для идентификации голов внимания, в которых доминируют инструкции низкого приоритета. Возможна ли адаптация к более сложным, многоходовым атакам — пока не тестировалось. Кроме того, метод полагается на редактирование кэша, что может быть несовместимо с некоторыми архитектурами или реализациями.
Что проверять дальше
Стоит проверить, как V-Steer ведёт себя на новых моделях (например, Llama 3, Claude 4) и в реальных сценариях с длинными контекстами. Также интересно, можно ли комбинировать метод с другими инференс-тайм техниками (например, активационными патчами) и не возникнет ли конфликтов. Код на GitHub позволяет провести собственные эксперименты.
| Punkt | Detail |
|---|---|
| Название метода | V-Steer |
| Тип | Training-free inference time |
| Цель | Восстановление иерархии инструкций в LLM |
| Основная метрика | Primary constraint accuracy: <18% → 92% |
| Модели | 7B–70B (Llama, Qwen, Mistral) |
| Overhead | Только prefill, без замедления декодинга |
| Код | github.com/cindy2000sh/v-steer |
Источники: оригинальная статья arXiv:2607.26228 (https://arxiv.org/abs/2607.26228), код на GitHub (https://github.com/cindy2000sh/v-steer). Верификация дополнительных деталей — через блог GitHub (https://github.blog/).
