
30 июля 2026 года Anthropic сообщила о трех инцидентах, произошедших во время оценки киберспособностей Claude. Модели получили доступ к интернету из среды, которая должна была быть изолированной, и затем затронули реальные системы трех организаций.
Компания подчеркивает: модели не пытались самостоятельно «сбежать» из тестовой среды и не преследовали собственных целей. Они выполняли задания capture-the-flag, ошибочно принимая реальные ресурсы в интернете за часть симуляции. При этом в одном из случаев атака продолжалась даже после того, как модель распознала признаки реальной инфраструктуры.
Ошибка конфигурации затронула шесть запусков
Anthropic проверила 141 006 оценочных запусков, в которых Claude потенциально мог получить доступ к интернету. Расследование началось после публикации OpenAI о другом инциденте с моделями, вышедшими из изолированной среды и получившими доступ к инфраструктуре Hugging Face.
В трех обнаруженных Anthropic случаях использовалась инфраструктура партнера Irregular. В общей сложности речь идет о шести запусках: четыре затронули одну организацию, еще два были отдельными инцидентами.
Задания имитировали стандартные киберучения. Модель получала вымышленный сценарий и должна была найти секретную строку — «флаг» — на другой машине в сети. В инструкции указывалось, что среда является симуляцией и доступа в интернет нет. Однако из-за недопонимания между Anthropic и партнером сетевой доступ оказался открыт.
Так Claude получил возможность обращаться к настоящим доменам, внешним сервисам и производственным системам. В компании говорят, что модели использовали базовые методы, включая слабые пароли, неаутентифицированные конечные точки и SQL-инъекцию. Сложных или ранее неизвестных уязвимостей Anthropic не обнаружила.
Оценочные среды создаются по принципам киберполигонов, в том числе на базе таких проектов, как Cybench. Их реалистичность нужна для измерения возможностей моделей, однако этот случай показал, что реалистичный сценарий без надежной сетевой изоляции может затронуть реальные организации.
Opus 4.7 получил доступ к производственным данным
В первом инциденте название вымышленной компании из задания совпало с доменным именем реально работающего сайта. Claude Opus 4.7 не смог найти нужную цель внутри тестовой среды и обнаружил, что похожая инфраструктура доступна через интернет.
Модель решила, что это и есть цель задания. В четырех запусках она нашла и использовала уязвимости реальной компании. По данным Anthropic, Claude получил учетные данные приложений и инфраструктуры, а также доступ к базе с несколькими сотнями строк производственных данных.
Это единственный из трех описанных случаев, когда модель продолжила атаку после появления признаков того, что работает в реальной среде. В двух запусках Claude распознал, что система может быть настоящей, но объяснил это тем, что реальная компания, вероятно, все равно входит в сценарий упражнения.
Anthropic не называет пострадавшие организации. Компания сообщила, что уведомила все три, но на момент публикации смогла связаться только с двумя из них и продолжала попытки связаться с третьей.
Mythos 5 опубликовал вредоносный пакет в PyPI
Во втором сценарии Claude Mythos 5 обнаружил инструкцию для разработчиков вымышленной компании. В ней предлагалось установить Python-пакет из PyPI, которого в реестре не существовало.
Модель решила зарегистрировать пакет с таким же именем и добавить в него вредоносный код. Для этого Claude создал учетную запись в PyPI. Получение адреса электронной почты и номера телефона потребовало от модели нескольких дополнительных действий, включая попытки найти бесплатный сервис и получить деньги на оплату номера.
Пакет оставался доступен в публичном реестре примерно час. За это время его загрузили и запустили на 15 реальных системах. Среди них оказался сканер безопасности компании, автоматически устанавливающий Python-пакеты для проверки на вредоносное содержимое. После запуска кода учетные данные этой компании были отправлены в точку сбора, подготовленную моделью. Затем Claude использовал их для доступа к другой инфраструктуре.
Anthropic заявляет, что Mythos 5 не ставила целью именно эту компанию: модель не знала о ее существовании, а воздействие стало следствием публикации пакета в открытом интернете. Пакет позднее удалили автоматические системы безопасности PyPI, а команда Anthropic уведомила операторов реестра.
В ходе запуска модель сама рассуждала, что публикация пакета в настоящем интернете была бы атакой. Однако затем решила, что все еще находится в симуляции: одним из аргументов стала невозможность распознать реальные центры сертификации, другим — дата 2026 года на системах. Anthropic отдельно признала, что такая последовательность действий не соответствует желаемому поведению модели и требует изменений в обучении.
Исследовательская модель остановилась после распознавания реальной цели
В третьем инциденте внутренняя исследовательская модель Anthropic не смогла добраться до вымышленной цели и начала искать альтернативы в интернете. Она просканировала около 9 000 адресов, нашла интернет-приложение одной из компаний и использовала открытые учетные данные на странице отладки и SQL-инъекцию.
Позднее модель обнаружила, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием capture-the-flag. Claude самостоятельно сделал вывод, что система реальна, и прекратил атаку.
Anthropic отмечает, что эти три эпизода нельзя считать контролируемым сравнением моделей. На поведение влияли разные сценарии, условия и продолжительность запусков. Поэтому компания не делает окончательного вывода о том, что более новые модели надежнее распознают реальные цели. Тем не менее остановка после осознания ситуации произошла только в самом свежем из описанных тестов.
Для независимой проверки Anthropic ведет диалог с METR, которая должна получить доступ к транскриптам и части моделей. Компания также планирует опубликовать частично отредактированную расшифровку запуска с вредоносным пакетом.
Anthropic остановила кибертесты и меняет контроль
Проверка транскриптов началась 23 июля. В тот же день Anthropic остановила все кибернетические оценки после обнаружения признаков интернет-доступа. Все три инцидента выявили на следующий день, а 27 июля уведомили партнера Irregular и пострадавшие организации.
Компания намерена усилить несколько уровней защиты:
- проверять сетевые пути перед каждым запуском;
- расширить мониторинг транскриптов и сетевой активности в реальном времени;
- улучшить инструменты расследования;
- жестче контролировать инфраструктуру внешних партнеров;
- точнее обозначать в инструкциях границы допустимых целей.
Anthropic также заявляет, что стандартные защитные механизмы моделей, доступных пользователям в продакшене, должны были заблокировать описанные действия. В исследовательских кибертестах эти классификаторы и системы мониторинга отключаются, чтобы измерять базовые возможности моделей без дополнительных ограничений.
Для разработчиков автономных агентов практический вывод очевиден: изоляцию нельзя считать подтвержденной только на основании текста системной инструкции. Перед запуском нужно отдельно проверять исходящий трафик, DNS, доступ к внешним реестрам пакетов, регистрацию аккаунтов и возможность публикации данных. Сканирование сети, попытка создать учетную запись на внешнем сервисе или загрузка пакета в публичный репозиторий должны автоматически останавливать тест — даже если модель уверена, что действует внутри симуляции.