OpenAI остановила кампанию по краже рассуждений, но та же атака неделями работала в Azure

Исследователи показали, что после блокировки извлечения скрытого хода мыслей в API OpenAI, атака воспроизводилась на Microsoft Azure вплоть до конца сентября, включая модель GPT-6 Astra. Защита облачных конечных точек отстаёт от исправлений на собственных серверах разработчика — и это открывает лазейки для дистилляции.

Схема переноса зашифрованных цепочек рассуждений между сессиями и расшифровки через более дешёвую модель Azure OpenAI
Схема переноса зашифрованных цепочек рассуждений между сессиями и расшифровки через более дешёвую модель Azure OpenAI
Изображение из исходного материала

OpenAI сообщила о пресечении масштабной кампании, в ходе которой более 15 000 учётных записей пытались скопировать скрытые рассуждения её моделей. Однако уже на следующий день независимая группа исследователей опубликовала обновление, показавшее, что тот же метод извлечения продолжал работать на платформе Microsoft Azure вплоть до 27 сентября — даже для новой модели GPT-6 Astra. Инцидент обнажил разрыв между защитой собственных API разработчиков и безопасностью облачных конечных точек, через которые модели продаются корпоративным клиентам.

Как работает атака на скрытые цепочки рассуждений

Атака использует механизм, который исследователи называют враждебной дистилляцией (adversarial distillation). Современные модели, прежде чем дать финальный ответ, формируют внутреннюю цепочку рассуждений. Обычно пользователю виден только итог, а промежуточные шаги передаются в зашифрованном виде. Если злоумышленник извлекает этот зашифрованный пакет из одного сеанса и передаёт его в другом разговоре вместе с инструкцией расшифровать, модель — особенно более дешёвая из того же семейства — способна дословно воспроизвести скрытые шаги.

Исследователь Йоахим Шеффер с соавторами ещё в предыдущей работе описал, что зашифрованные пакеты используют общие ключи, что позволяет переносить их между сессиями, пользователями и даже разными моделями одного провайдера. OpenAI официально поблагодарила группу и подтвердила, что обнаруженные маршруты атаки были реальными и помогли ускорить внедрение контрмер.

Реакция OpenAI: блокировка сети и закрытие лазеек

Согласно блогу OpenAI, атака началась с низкой интенсивностью 1 июля, а 24–25 июля достигла пика в 16 000 запросов от более чем 4 000 пользователей. Расследование выявило сеть из 15 000 учётных записей со схожими паттернами. Компания отключила все связанные аккаунты к 28 июля, ужесточила процедуру регистрации и закрыла техническую возможность повторно использовать чужие зашифрованные логи рассуждений. Кроме того, в потоковых выводах теперь анализируется контент, и если он может раскрыть внутренние шаги, вывод задерживается.

OpenAI связала ядро активности с людьми, имеющими отношение к Moonshot AI (создателю модели Kimi), но отмечает, что неясно, восходят ли все наблюдавшиеся акторы к единому источнику. Полученными данными компания поделилась через Frontier Model Forum и правительственные каналы, поскольку проблема затрагивает не только её модели. Схожие попытки ранее фиксировала и Anthropic.

Azure остаётся уязвимым: проверка 13 сентября и запоздалые патчи

В обновлённой статье от 1 октября 2026 года исследователи сообщили, что 13 сентября атака успешно воспроизводилась на Microsoft Azure. Им удалось извлечь рассуждения каждой протестированной модели OpenAI, включая выпущенную недавно GPT-6 Astra, и моделей Anthropic вплоть до Sonnet 5. Для успеха хватало единственной попытки. При этом на собственных API OpenAI и Anthropic аналогичные попытки уже блокировались.

«Одни и те же модели, но разная защита в зависимости от того, какая платформа их обслуживает», — прокомментировал Шеффер. Защитные меры появились на конечной точке Azure OpenAI лишь 27 сентября: спустя две недели после демонстрации уязвимости. Для моделей Anthropic извлечение перестало воспроизводиться на Azure с 28 сентября. Группа утверждает, что патчи носят фрагментарный и поверхностный характер, во многом полагаясь на жёсткое совпадение конкретных паттернов запросов, и что облачные версии новых моделей запускались изначально без каких‑либо защит.

Упрощённый метод с виртуальным блокнотом

Разработчик Джан Бёлюк публично продемонстрировал ещё более простой способ: модели давали виртуальный блокнот как инструмент и инструкцию записывать туда свои рассуждения; пользователь после этого свободно читал содержимое. Этот вектор сработал на всех моделях OpenAI, а также на Opus 4.8 и Sonnet 5. Не раскрыли внутренние шаги только Opus 5, Fable 5 и Fable 5.1. По оценке исследователей, полученные таким способом данные были столь же подробны и пригодны для дистилляции, как и результаты расшифровки зашифрованных пакетов.

Что это меняет для разработчиков и корпоративных пользователей

Разбирательство подтвердило, что безопасность рассуждений модели не является унифицированной характеристикой: она может радикально отличаться в зависимости от конечной точки развёртывания. Компании, использующие Azure OpenAI для инференса, должны самостоятельно аудировать, блокируются ли попытки извлечения на выбранном ими тарифе. Провайдерам облачных API предстоит синхронизировать патчи с оригинальными разработчиками, иначе злоумышленники будут просто выбирать платформу с самыми слабыми защитами.

Исследователи идут дальше: в обновлённой статье они аргументируют, что облачные провайдеры, не способные обеспечить эквивалентную защиту, вообще не должны обслуживать модели, раскрывающие цепочки рассуждений. В противном случае открытые бэкдоры фактически позволяют обходить экспортный контроль на уровне API. OpenAI, со своей стороны, признаёт, что модели на партнёрских платформах нуждаются в той же защите, что и её собственные сервисы, и работа в этом направлении ещё не завершена.

Хронология событий

В таблице собраны ключевые даты инцидента, зафиксированные в отчёте OpenAI и обновлении исследователей.

Дата | Событие
1 июля | Начало попыток враждебной дистилляции с низкой интенсивностью (OpenAI)
24–25 июля | Пик атаки: 16 000 запросов от 4 000 пользователей (OpenAI)
28 июля | Отключение всей сети из 15 000 учётных записей (OpenAI)
13 сентября | Успешное извлечение рассуждений на Azure для GPT-6 Astra и моделей Anthropic (исследователи)
27 сентября | Добавление защит на конечную точку Azure OpenAI для моделей OpenAI (исследователи)
28 сентября | Прекращение воспроизводимости атаки на моделях Anthropic в Azure (исследователи)

Ожидается, что по мере роста возможностей ведущих моделей и удешевления платформенного доступа число подобных попыток дистилляции будет только увеличиваться. Для тех, кто отвечает за выбор инфраструктуры, урок прагматичен: безопасность рассуждений теперь надо проверять не только по документации вендора, но и прямым тестированием на каждом используемом облачном эндпоинте.

Источники