Запись архива

OpenAI проверила gpt-oss на риски после злонамеренного дообучения

OpenAI попыталась усилить опасные возможности открытой модели gpt-oss с помощью специального дообучения. Проверка охватила биологические и киберриски — области, где доступ к весам меняет подход к безопасности.

Исследование безопасности открытой модели OpenAI gpt-oss
Исследование безопасности открытой модели OpenAI gpt-oss
Student Studying in the Communications Library (11056585003).jpg | by University of Illinois Library | wikimedia_commons | CC BY 2.0

5 августа 2025 года OpenAI представила исследование о рисках выпуска мощных языковых моделей с доступными весами. Компания проверяла не только исходную версию gpt-oss, но и намеренно дообученные варианты, рассчитанные на усиление возможностей в биологии и кибербезопасности.

Методику OpenAI называет malicious fine-tuning, или MFT — «злонамеренное дообучение». Ее задача состоит в том, чтобы приблизительно оценить верхнюю границу опасных возможностей модели после того, как сторонний разработчик получит веса, специализированные данные и вычислительные ресурсы.

Исследование опубликовано одновременно с выпуском семейства gpt-oss. Поэтому gpt-oss — не гипотетическая система, как можно было заключить из ранних пересказов работы, а название выпущенных OpenAI моделей с открытыми весами. Компания представила два варианта: gpt-oss-120b и gpt-oss-20b.

Почему обычной проверки модели здесь недостаточно

При доступе к модели через облачный API поставщик сохраняет контроль над инфраструктурой. Он может фильтровать запросы и ответы, ограничивать учетные записи, отслеживать аномальную активность и обновлять защитные механизмы.

С открытыми весами ситуация принципиально другая. Пользователь может запустить модель локально, изменить системные инструкции, отключить внешние фильтры и провести дополнительное обучение. Разработчик исходной модели уже не контролирует конкретную развернутую копию.

Поэтому стандартная оценка отказов на опасные запросы показывает лишь поведение выпущенной версии. Она не отвечает на более сложный вопрос: какими станут возможности модели после целенаправленной модификации ее весов.

В исследовании рисков gpt-oss OpenAI попыталась смоделировать сильного атакующего. Исследователи специально дообучали модель для повышения результативности в выбранных опасных областях, а затем повторно оценивали ее возможности.

Такой тест не доказывает, что злоумышленник обязательно сможет воспроизвести тот же результат. Он также не охватывает все возможные данные, методы обучения и будущие улучшения инструментов. Это оценка одного из неблагоприятных сценариев, а не точный прогноз реальных атак.

Что проверяли в биологии и кибербезопасности

OpenAI сосредоточилась на двух категориях из собственной системы оценки передовых рисков: биологических угрозах и кибербезопасности.

В биологическом направлении оценивается, насколько модель способна помогать при выполнении сложных профильных задач и сокращать путь от общедоступных научных знаний к практически значимой работе. Исследование касается возможностей модели, но не подтверждает, что gpt-oss самостоятельно способна создать биологическую угрозу или заменить лабораторную экспертизу.

Кибернаправление охватывает способности, которые могут пригодиться при поиске и эксплуатации уязвимостей. Здесь также необходимо разделять результаты тестов и реальные операции: оценка модели в подготовленной среде не равна доказательству успешной атаки на действующую инфраструктуру.

По заявлению OpenAI, даже специально усиленные варианты gpt-oss не достигли уровня «High» в этих двух категориях по критериям Preparedness Framework компании. Это вывод самой OpenAI, полученный по ее методике и порогам. Его не следует интерпретировать как универсальную гарантию безопасности для любого варианта дообучения или развертывания.

Описание выпущенных моделей и заявленных проверок приведено в анонсе gpt-oss. Технические материалы и инструкции для запуска компания разместила в официальном репозитории gpt-oss на GitHub.

MFT оценивает возможности, а не только защитные ответы

Злонамеренное дообучение отличается от обычного red teaming. При классической проверке специалисты ищут запросы, которые заставят готовую модель нарушить ограничения. MFT предполагает изменение самой модели, чтобы повысить ее результативность в определенном классе задач.

Это различие существенно для команд, выбирающих между API и самостоятельным размещением LLM. Отказ модели отвечать на опасный запрос еще не означает, что базовая способность отсутствует. Иногда ограничение связано с обучением безопасному поведению или внешним фильтром, которые можно изменить после получения весов.

С другой стороны, доступ к весам сам по себе не превращает модель в эффективный инструмент атаки. Для результативного дообучения требуются подходящие данные, экспертиза, вычислительные ресурсы и методика оценки. Исследование OpenAI не устанавливает, насколько легко независимый участник сможет повторить проведенный компанией эксперимент.

Публикация также не охватывает все возможные риски открытого распространения. Она сосредоточена на двух заранее выбранных областях. Из нее нельзя автоматически делать выводы о мошенничестве, автономных агентах, дезинформации или других сценариях использования.

Что меняется для разработчиков open-weight систем

Для разработчиков главный вывод заключается не в том, что открытые модели «безопасны» или «опасны» по определению. Исследование показывает, что при оценке такой системы нужно учитывать как минимум три разных состояния:

  • исходную модель с настройками автора;
  • локальную версию без части защитных механизмов;
  • специально дообученный вариант, оптимизированный под нежелательную задачу.

Команде, которая размещает gpt-oss или другую модель с доступными весами, стоит проверять именно свою сборку. Результаты производителя не учитывают локальные адаптеры, новые наборы данных, подключенные инструменты, права агента и особенности инфраструктуры.

Перед внедрением можно провести несколько конкретных проверок:

  • зафиксировать происхождение весов и сверить файлы с официальным репозиторием;
  • задокументировать все дообучения, адаптеры и изменения шаблона запросов;
  • отдельно протестировать модель после каждого обновления;
  • ограничить доступ агента к оболочке, сети, секретам и производственным системам;
  • не считать встроенный отказ достаточной защитой, если пользователь контролирует веса;
  • оценивать не только текстовые ответы, но и действия модели с подключенными инструментами.

Если модель используется через API, часть контроля остается у поставщика. При локальном развертывании ответственность за журналирование, разграничение доступа, изоляцию среды и реагирование на злоупотребления переходит к оператору.

Какие ограничения остаются у оценки OpenAI

Работа OpenAI дает ориентир для проверки наихудшего сценария, но не закрывает вопрос безопасности открытых моделей. Методика зависит от выбранных тестов, порогов и качества подготовленного дообучения. Будущие алгоритмы, новые данные или более крупные вычислительные бюджеты могут изменить результат.

Кроме того, заявленные выводы относятся к gpt-oss и проведенным OpenAI экспериментам. Их нельзя без дополнительной проверки переносить на Llama, Mistral, Qwen или другие семейства моделей.

Практическое значение исследования — в смене объекта оценки. Для open-weight LLM недостаточно проверить только опубликованный чат-интерфейс. Разработчикам и аудиторам необходимо выяснять, какие способности могут появиться после снятия ограничений и целевого дообучения. При этом опубликованные OpenAI результаты остаются оценкой самого разработчика; независимое воспроизведение MFT-тестов потребует доступа к сопоставимым данным, вычислениям и процедурам измерения.

Источники