
28 сентября 2026 года на arXiv появился препринт о каскадных атаках на навыки ИИ-агентов. Авторы называют новый класс угроз skill cascading attacks: вредоносная задача разбивается на несколько изменений, каждое из которых может выглядеть допустимым при отдельной проверке. Опасный эффект возникает при последовательном выполнении нескольких навыков.
Для изучения этой проблемы исследователи создали автоматизированный фреймворк SkillCascade и бенчмарк SkillCascade-Bench из 213 проверенных тестовых случаев. В аннотации работы говорится, что атаки испытывались на нескольких агентных системах, включая OpenClaw, Claude Code и Codex, а также с разными языковыми моделями в качестве основы.
Главный вывод авторов: проверка каждого подключаемого навыка по отдельности не гарантирует безопасность всей цепочки. Результаты пока следует воспринимать как заявление исследовательской команды — препринт не равнозначен завершенной независимой проверке, а аннотация не приводит детальной разбивки успешности атак по системам и моделям.
Вредоносная логика распределяется между компонентами
Под навыком в работе понимается модульный пакет, который агент может загрузить во время выполнения задачи. Такой пакет способен включать инструкции на естественном языке, исполняемые скрипты и справочные материалы. Навыки позволяют добавлять функции без полной переработки агента, однако сторонний код и инструкции становятся частью общей цепочки принятия решений.
При обычной атаке подозрительное действие можно попытаться обнаружить внутри одного модуля: например, навык явно требует отправить закрытые данные на внешний сервер или изменить защищенный файл. В каскадном сценарии ни один компонент не обязан содержать полную вредоносную последовательность.
Один навык может незначительно изменить входные данные, второй — понизить приоритет определенной категории результатов, третий — исключить низкоприоритетные элементы из итогового ответа. Изолированный анализ каждого шага способен признать его допустимым. После объединения шагов агент выдает результат, которого не должно было быть.
Это отличает описанную угрозу от простой установки заведомо вредоносного расширения. Защитной системе требуется учитывать порядок вызовов, передачу состояния между модулями и накопительный эффект преобразований.
Пример с проверкой лекарственных назначений
В препринте приведен сценарий, связанный с анализом рецептов. Первый навык ослабляет сигналы о недавно отмененных препаратах в извлеченной истории пациента. Второй снижает оценку серьезности лекарственных взаимодействий, если они связаны с такими препаратами. Третий убирает из итоговой сводки предупреждение, уже получившее низкий приоритет.
В результате потенциально серьезное предупреждение может не попасть к врачу. При этом отдельные операции можно представить как нормализацию медицинской истории, настройку оценки риска и сокращение итогового отчета.
Этот пример показывает, почему одной проверки текста инструкций недостаточно. Вредоносный результат зависит от данных, измененных предыдущими компонентами, и от правил, применяемых на следующих этапах. Сканер, который не восстанавливает всю цепочку, может не увидеть исходную цель.
Работа не сообщает о реальном инциденте в медицинской организации. Речь идет о тестовом сценарии, предназначенном для демонстрации класса уязвимостей. На основании препринта также нельзя делать вывод, что конкретные развернутые медицинские системы уже были скомпрометированы таким способом.
Что показали испытания SkillCascade
По утверждению авторов, SkillCascade автоматически формирует многошаговые тесты, в которых опасная задача распределяется между навыками. SkillCascade-Bench содержит 213 валидированных случаев для разных агентных систем и предметных областей.
В аннотации указано, что каскадные взаимодействия вызывали вредоносное поведение на представительных агентах и разных LLM-бэкендах. Авторы также сообщают об обходе существующих сканеров отдельных навыков и средств наблюдения во время выполнения.
Однако доступное описание не раскрывает несколько деталей, необходимых для оценки практического масштаба проблемы:
- долю успешных атак для каждого агента и каждой модели;
- конфигурации сканеров и мониторов, использованных в экспериментах;
- число навыков в типичной атакующей цепочке;
- влияние системных инструкций, разрешений и песочниц;
- частоту ложных срабатываний возможной защиты.
Claude Code и Codex упоминаются как испытанные системы, однако это не означает, что их разработчики подтвердили выводы работы. С назначением и возможностями продуктов можно свериться отдельно в официальной документации Claude Code и на странице Codex от OpenAI. Эти страницы дают продуктовый контекст, но не являются независимым подтверждением результатов SkillCascade.
В аннотации также нет данных о том, использовали ли исследователи стандартные настройки продуктов, модифицированные окружения или экспериментальные конфигурации. Поэтому сравнивать безопасность перечисленных агентов только по факту их присутствия в работе преждевременно.
Что проверить разработчикам агентных систем
Практическое следствие исследования касается платформ, которые разрешают агенту подключать несколько сторонних навыков, передавать между ними данные и автоматически выбирать следующий инструмент. В такой архитектуре доверие к каждому отдельному пакету не покрывает риск их композиции.
Перед добавлением нового навыка разработчикам стоит проверить не только его собственные инструкции и скрипты, но и несколько сочетаний с уже установленными компонентами. Особого внимания требуют цепочки, где один модуль меняет данные или метаданные, следующий выставляет оценку риска, а последний фильтрует итоговый ответ.
Минимальная проверка может включать:
- журналирование входных и выходных данных каждого навыка;
- фиксацию порядка вызовов и изменений общего состояния;
- повторный запуск критических сценариев с отключением отдельных компонентов;
- тестирование комбинаций навыков в изолированной среде;
- запрет автоматического подавления предупреждений без отдельного правила;
- пересмотр разрешений после установки нового пакета или обновления существующего.
Для задач с высокой ценой ошибки — медицины, финансовых операций, доступа к корпоративным данным — полезно проверять конечное решение независимо от промежуточных оценок агента. Если предупреждение исчезло после нескольких преобразований, журнал должен позволять восстановить, какой компонент изменил его статус и почему.
SkillCascade указывает на разрыв между целостностью отдельных модулей и безопасностью собранной системы. Пока нет подробных результатов по каждой конфигурации, работа не доказывает одинаковую уязвимость всех агентных платформ. Она дает разработчикам конкретный тест: оценивать навыки не только по одному, а в тех последовательностях, которые агент действительно способен выполнить.







