Запись архива

OpenAI опубликовала методологию оценки биорисков от LLM: эксперимент с GPT-4 показал «небольшое улучшение» без статистической значимости

Исследование с участием 100 биологов и студентов показало, что GPT-4 даёт незначительный прирост точности в задачах по созданию биологических угроз по сравнению с доступом к интернету. Результаты не являются статистически значимыми, но формируют основу для системы раннего предупреждения.

Схема методологии оценки биорисков от OpenAI: пять этапов процесса и пять метрик в исследовании с GPT-4
Схема методологии оценки биорисков от OpenAI: пять этапов процесса и пять метрик в исследовании с GPT-4
College of DuPage Hosts Career Fair 2016 5 | by COD Newsroom | openverse | by

OpenAI представила методологию эмпирической оценки того, насколько большие языковые модели могут способствовать созданию биологических угроз. В исследовании, опубликованном 31 января 2024 года и доступном в блоге компании, участвовали 100 человек — 50 биологов с докторской степенью и лабораторным опытом, а также 50 студентов, прослушавших как минимум один университетский курс биологии. Участников случайным образом разделили на контрольную группу (только интернет) и тестовую (интернет плюс GPT-4). Им предстояло выполнить набор задач, охватывающих полный цикл создания биологической угрозы: от идеи и приобретения материалов до масштабирования, формулировки и высвобождения.

Результаты, по оценке самой OpenAI, демонстрируют «небольшое улучшение» (mild uplift) в точности и полноте ответов. По десятибалльной шкале точности средний прирост для экспертов составил 0,88 балла, для студентов — 0,25 балла. По полноте ответов — 0,82 для экспертов и 0,41 для студентов. Однако, как подчёркивается в отчёте, полученные размеры эффекта недостаточно велики, чтобы быть статистически значимыми. Компания отмечает, что необходимы дальнейшие исследования для определения пороговых значений, указывающих на реальное повышение риска.

Структура оценки и методологические принципы

Разработчики методики исходили из того, что текущая угроза от LLM в первую очередь связана с расширением доступа к уже существующей информации об известных угрозах, а не с генерацией принципиально новых знаний. Это определило три ключевых принципа дизайна эксперимента. Во-первых, оценка должна проводиться с участием людей, а не в автоматическом режиме, поскольку эффективное использование модели требует итеративного взаимодействия, корректировки запросов и исправления ошибок модели. Во-вторых, необходимо добиваться полного раскрытия возможностей модели — для этого участники прошли обучение лучшим практикам взаимодействия с GPT-4. В-третьих, в отличие от стандартных бенчмарков, задача не сводилась к проверке фактов по фиксированному рубрикатору, а имитировала реальный сценарий злонамеренного использования.

Исследование проводилось в рамках Preparedness Framework — внутренней системы оценки рисков OpenAI, которая была представлена ранее. В компании подчёркивают, что предоставление доступа к информации само по себе недостаточно для создания биологической угрозы, и эксперимент не проверяет успешность физического конструирования угроз.

Контекст и ограничения исследования

Самой важной оговоркой остаётся отсутствие статистической значимости полученных результатов. Это означает, что наблюдаемое улучшение может быть следствием случайных факторов, а не реального вклада модели. OpenAI признаёт, что статистическая значимость как метод измерения рисков модели имеет ограничения, и призывает к разработке новых подходов к оценке осмысленности результатов.

Дополнительным ограничением является фокус исключительно на информационном доступе. Исследователи выделяют два основных пути влияния ИИ на биориски: расширение доступа к информации о известных угрозах (изучено в данной работе) и создание принципиально новых угроз (оставлено для будущих исследований). В отчёте также отмечается, что в реальном сценарии злоумышленник мог бы использовать модель для пошагового протоколирования, решения проблем с мокрыми лабораторными процедурами или даже автономного выполнения этапов при интеграции с облачными лабораториями, но эти сценарии пока не были эмпирически проверены.

Реакция сообщества и независимые оценки

Публикация OpenAI вызвала дискуссию в профессиональном сообществе. На платформе SecureBio, которая ведёт каталог исследований uplift-эффекта (оценки прироста возможностей при использовании ИИ), работа OpenAI фигурирует как одна из ключевых в этой области. Среди других значимых работ — исследования Anthropic по внутренним оценкам моделей Claude с удалёнными защитными механизмами, а также эксперименты Meta в рамках релиза Llama 3.

В недавнем отчёте Национальных академий наук, инженерии и медицины США (апрель 2025 года) отмечается, что интеграция ИИ в биологические науки находится на ранней стадии, и существует явный недостаток эмпирических данных об оценке потенциальных рисков. Большинство существующих оценок, включая работу OpenAI, фокусируются на общих чат-ботах, а не на специализированных биологических инструментах ИИ.

Практическое значение для разработчиков и исследователей

Для тех, кто работает в области безопасности ИИ, данное исследование представляет собой важный методологический precedent. Вместо абстрактных дискуссий о потенциальных угрозах OpenAI предлагает воспроизводимую процедуру оценки с конкретными метриками. Это позволяет другим лабораториям проводить аналогичные тесты на своих моделях и сравнивать результаты.

Ключевой вывод для практиков: текущее поколение LLM, по крайней мере на уровне GPT-4, не демонстрирует убедительного прироста способностей к созданию биологических угроз по сравнению с тем, что уже доступно через интернет. Однако отсутствие доказательств — не доказательство отсутствия риска. Компания призывает к широкому обсуждению методологии и обмену методами оценки в сообществе, чтобы совместно выработать более надёжные индикаторы опасности.

OpenAI планирует продолжать исследования в этом направлении, включая оценку более новых моделей (o1, o3) и расширение сценариев тестирования за пределы информационного доступа. Публикация полного текста отчёта и процедуры оценки позволит независимым исследователям верифицировать результаты и адаптировать методологию для своих задач.

Источники