
Anthropic сделала режим Auto Mode стандартным для Claude Code и заявила о его высокой эффективности против prompt-инъекций. Однако исследователь Йоханн Ребергер обнаружил атаку, которая обходит защиту в 80% случаев — и в некоторых тестах сам механизм безопасности мешал агенту остановить вредоносный код.
Как работает атака
Ребергер обманул Claude Code, заставив его скачать и распаковать ZIP-архив. Внутри архива находился файл struct.py — подмена стандартного модуля Python. Когда агент выполнял команду import base64, он не проверял, что в локальной директории уже лежит вредоносный struct.py. Импорт происходил из архива, а не из системной библиотеки.
Таким образом, вредоносный код получал управление на уровне интерпретатора Python. Агент не замечал подмены, поскольку не сверял хэши файлов и не проверял происхождение загружаемых модулей. Ребергер утверждает, что атака срабатывает в 80% тестовых запусков.
Защита блокирует собственную остановку
Ключевая проблема, которую выявил Ребергер, касается самого механизма безопасности. В нескольких тестовых запусках Claude замечал компрометацию и пытался завершить вредоносный процесс. Однако Auto Mode блокировал эту команду очистки.
«Система безопасности сама становится частью отказа. Классификатор разрешил создание вредоносного процесса, но затем заблокировал команду, предназначенную для его остановки», — написал Ребергер в своем отчете.
Это означает, что механизм Auto Mode не только не предотвращает атаку, но и активно мешает агенту исправить ситуацию после обнаружения угрозы.
Позиция Anthropic
Anthropic пока не выпустила официального заявления по поводу находки Ребергера. Компания ранее утверждала, что Auto Mode обеспечивает надежную защиту от prompt-инъекций, и рекомендовала его как стандартный режим для Claude Code.
На момент публикации этой статьи неизвестно, готовит ли Anthropic исправление или пересматривает архитектуру безопасности. Ребергер предоставил компании детали атаки до публикации, следуя стандартной практике ответственного раскрытия уязвимостей.
Что рекомендуют эксперты
Саймон Уиллисон, поддерживающий выводы Ребергера, подчеркивает: единственный безопасный способ запуска агентов при риске атаки — использование песочницы. Он приводит следующие рекомендации:
Запускайте unattended-агентов в контейнере, виртуальной машине или OS-песочнице.
Ограничьте сетевой трафик на выход.
Мониторьте действия агентов в реальном времени.
Не предоставляйте агенту доступ к домашним директориям, SSH-ключам, облачным учетным данным и другим критическим ресурсам.
Эти меры снижают ущерб даже в случае успешной атаки, поскольку изолируют среду выполнения.
Что пока не подтверждено
На данный момент нет информации о том, использовалась ли эта уязвимость в реальных атаках на пользователей Claude Code. Ребергер тестировал метод в контролируемых условиях. Неизвестно, планирует ли Anthropic изменить режим Auto Mode или добавить дополнительные проверки при импорте модулей.
Также неясно, затрагивает ли уязвимость другие продукты Anthropic, использующие схожие механизмы защиты от prompt-инъекций.
Ключевые факты
| Параметр | Значение | Источник |
|---|---|---|
| Атака | Обход Auto Mode через ZIP-архив с подменой модуля Python | Йоханн Ребергер |
| Процент успеха | 80% тестовых запусков | Йоханн Ребергер |
| Дата публикации | 27 августа 2026 года | Simon Willison / Ребергер |
| Продукт | Claude Code (режим Auto Mode) | Anthropic |
| Рекомендация | Запуск в изолированной среде (песочнице) | Саймон Уиллисон |
