Запись архива

RSP, Preparedness и FSF: как устроены рамки безопасности frontier AI

Разбираем три главные корпоративные рамки безопасности frontier AI — Anthropic RSP, OpenAI Preparedness Framework и Google DeepMind FSF: пороги риска, evals, mitigations, governance и слабые места.

Сравнительная схема RSP Anthropic, Preparedness Framework OpenAI и FSF Google DeepMind с порогами риска, evals, mitigations и governance-решениями

В 2024 году разговор о безопасности frontier-моделей сместился от общих принципов к публичным корпоративным рамкам: Anthropic развивала Responsible Scaling Policy (RSP), OpenAI применяла Preparedness Framework, а Google DeepMind 17 мая 2024 года представила Frontier Safety Framework (FSF). Исторически это не три полностью синхронных документа одного года: RSP был впервые опубликован 19 сентября 2023 года и уточнялся в 2024-м, beta-версия Preparedness Framework вышла 18 декабря 2023 года и использовалась в релизах 2024 года, а FSF стартовал как новый документ уже в мае 2024-го. Важно читать их не как набор общих обещаний, а как попытки превратить абстрактное «быть осторожнее» в операционные правила: что считать опасным порогом, как это мерить, кто принимает решение и когда нужно тормозить разработку или деплой.

Коротко

  • RSP, Preparedness Framework и FSF — три варианта одной общей идеи: responsible capability scaling, то есть управления риском по мере роста возможностей модели.
  • Главное различие — в единице решения. Anthropic строит политику вокруг уровней ASL и capability thresholds, OpenAI — вокруг категорий риска и итогового score, DeepMind — вокруг Critical Capability Levels и связанных уровней mitigations.
  • Во всех трёх подходах есть одна и та же связка: thresholds → evaluations → mitigations → governance → возможность паузы.
  • Публичная прозрачность различается. Anthropic подробнее описывает внутреннее управление и обязательства, OpenAI показывает scorecards в system cards, DeepMind сильнее акцентирует раннее предупреждение и лестницу мер безопасности.
  • Слабое место у всех общее: наука dangerous capability evaluations ещё незрелая, а сами рамки в 2024 году оставались в основном добровольными корпоративными механизмами.

Контекст

Термины RSP, Preparedness и FSF появились не в пустоте. В октябре 2023 года британский документ Emerging Processes for Frontier AI Safety описал responsible capability scaling как один из базовых процессов для frontier AI: заранее определить пороги риска, привязать к ним конкретные меры, подготовить механизмы паузы и обеспечить внутреннюю подотчётность и внешнюю проверку. Уже 21 мая 2024 года на AI Seoul Summit компании, включая Anthropic, OpenAI и Google, публично согласились публиковать safety frameworks с порогами, mitigations, governance и прозрачностью.

Поэтому сравнивать RSP, Preparedness Framework и FSF лучше не как три несвязанных документа, а как три реализации одной архитектурной схемы. Для практиков это полезно: если вы строите eval-пайплайн, внутренний release review или policy для агентных систем, эти документы показывают, как крупные лаборатории переводят риск из уровня обсуждений в уровень процедур.

Метод

Anthropic: Responsible Scaling Policy

RSP версии 1.0, опубликованная 19 сентября 2023 года, изначально строилась вокруг AI Safety Levels (ASL), по аналогии с biosafety levels. Идея простая: при достижении более опасных capability thresholds лаборатория должна заранее перейти на более жёсткие меры безопасности, безопасности весов и правила деплоя. В документе прямо зафиксирована возможность остановить обучение или выпуск, если нужные меры ещё не готовы.

Для RSP характерны три черты. Во-первых, сильная связка между capability threshold и конкретным набором safeguards. Во-вторых, выделенная governance-роль: Responsible Scaling Officer, отчётность перед board и Long-Term Benefit Trust, а также обновление самой политики через формальный процесс. В-третьих, акцент на assurance: в майских Reflections on our Responsible Scaling Policy Anthropic отдельно пишет про stress-testing evals, внешнюю проверку и развитие «второй линии защиты». В крупном обновлении, объявленном 15 октября 2024 года, Anthropic также сместила политику в сторону более явных capability thresholds и подходов, вдохновлённых safety cases.

OpenAI: Preparedness Framework

Публичная beta-версия Preparedness Framework датирована 18 декабря 2023 года, а в 2024-м она стала видна прежде всего через system cards. Логика у OpenAI немного иная: вместо ASL-уровней используется набор tracked risk categories и итоговая оценка риска. В материалах 2024 года это категории cybersecurity, CBRN, persuasion и model autonomy.

Практический смысл framework у OpenAI — в decision rule. В GPT-4o System Card компания пишет, что модель с post-mitigation score выше «medium» не должна деплоиться, а модель выше «high» не должна продолжать развитие. Тем самым Preparedness работает как процедура допуска: сначала лаборатория проводит frontier evaluations, затем Safety Advisory Group рассматривает результаты и mitigations, после чего формируется решение о выпуске. Отдельная линия в этой конструкции — поиск «unknown unknowns»: её OpenAI описывала ещё в материале о команде Preparedness и challenge-программе.

Google DeepMind: Frontier Safety Framework

FSF версии 1.0 был представлен 17 мая 2024 года и сразу оформлен как отдельная рамка с техническим отчётом. Её базовая единица — Critical Capability Level (CCL): порог возможностей, после которого модель без дополнительных мер может создавать severe risk. В первой версии DeepMind рассматривала четыре домена: autonomy, biosecurity, cybersecurity и machine learning R&D.

Архитектура FSF трёхшаговая. Сначала лаборатория определяет CCL в риск-домене. Затем она запускает early warning evaluations, чтобы понять, приближается ли модель к этому порогу. После этого подбираются mitigations двух типов: security mitigations для защиты весов и deployment mitigations для ограничения злоупотребления критическими возможностями. В техническом отчёте DeepMind отдельно оговаривает, что если модель подходит к порогу, а адекватные меры ещё не готовы, дальнейший development или deployment должен быть поставлен на hold.

Результаты

Если свести три рамки к одной таблице, видно не только сходство, но и разные центры тяжести.

Рамка Публичная отправная точка Единица порога Домены риска в публичной версии 2024 Что связывает eval с решением Публичный артефакт
Anthropic RSP RSP v1.0 — 19.09.2023; рефлексия внедрения — 20.05.2024; крупное обновление — 15.10.2024 ASL и capability thresholds Катастрофические риски; в 2024 особый акцент на CBRN и autonomous AI R&D Переход к более жёстким ASL safeguards; при нехватке мер возможна пауза обучения или деплоя Policy PDF, версия политики, reflections и дальнейшие update-notes
OpenAI Preparedness Framework Beta — 18.12.2023; практическое применение публично видно в GPT-4o System Card от 08.08.2024 Категории риска и итоговый score Cybersecurity, CBRN, persuasion, model autonomy Модели с post-mitigation score выше medium не деплоятся; выше high не должны продолжать развитие Preparedness scorecards внутри system cards
Google DeepMind FSF FSF v1.0 — 17.05.2024 Critical Capability Levels и уровни mitigations Autonomy, biosecurity, cybersecurity, ML R&D Early warning evals и подбор security/deployment levels; при неготовых мерах — hold Technical report и объясняющий blog post

Общий паттерн у всех трёх один и тот же. Сначала лаборатория формулирует, какая способность или какой риск считаются недопустимыми без дополнительных мер. Затем пытается измерить приближение к этому порогу. Потом заранее описывает escalation path. И только после этого делегирует финальное решение какому-то governance-органу или роли.

Но различается то, что именно становится «объектом управления». У Anthropic это переход через capability threshold с заранее описанными safeguard standards. У OpenAI — остаточный риск после mitigations. У DeepMind — приближение к критическому capability level и соответствие нужному уровню security/deployment controls.

Интерпретация

Наш комментарий

На наш взгляд, эти документы важны не потому, что «доказывают безопасность», а потому, что задают форму разговора о ней. Они переводят вопрос из режима «модель кажется опасной» в режим «какой именно threshold сработал, какой eval это показал, какие mitigations обязаны включиться и кто отвечает за решение». Для инженерной организации это большой шаг вперёд, даже если сами thresholds пока спорны.

Ещё один важный сдвиг 2024 года — движение в сторону safety case-логики. Отдельная работа Safety Cases: How to Justify the Safety of Advanced AI Systems описывает safety case как структурированное обоснование того, что система вряд ли вызовет катастрофу. Этот язык уже просматривается в самих корпоративных рамках: Anthropic в обновлении 2024 года прямо пишет о методологиях, вдохновлённых safety cases, а DeepMind в FSF вводит deployment mitigation level, где фигурирует safety case с red team validation. То есть рынок постепенно сдвигается от «провели набор тестов» к «собрали структурированный аргумент о приемлемом остаточном риске».

Для практиков полезный вывод такой: лучший safety framework — не тот, где больше терминов, а тот, где у каждого threshold есть измерение, у каждого измерения есть владелец, у каждого владельца есть право остановить rollout, а у организации есть обязанность публично объяснить хотя бы часть логики. Именно эта связка, а не громкость формулировок, отличает рабочий governance-процесс от декларации.

Ограничения

  • Это добровольные корпоративные рамки, а не независимая сертификация. Seoul commitments прямо называют такие обязательства voluntary, а сами компании оставляют за собой право обновлять документы по мере развития науки и внешней среды.
  • Наука dangerous capability evaluations ещё незрелая. Anthropic в RSP v1.0 пишет, что дизайн таких evals — nascent area of research; DeepMind называет FSF exploratory and based on preliminary research; OpenAI тоже описывает Preparedness как living document.
  • Пороги частично остаются качественными. Даже когда есть формальные названия уровней, остаётся трудный вопрос: какой именно результат eval действительно означает неприемлемый реальный риск, а какой — только ранний warning.
  • Фокус узкий: severe или catastrophic risk, а не весь спектр harms. Эти документы не заменяют policy по bias, privacy, copyright, elections, labor impacts или product abuse. Обычно сами авторы прямо пишут, что framework лишь дополняет существующие safety practices.
  • Публичной информации по исполнению меньше, чем по дизайну. Мы лучше видим структуру документов, чем то, как именно внутри компаний проверяется адекватность mitigations, как часто меняются thresholds и насколько независим внутренний review.
  • Остаются риски under-elicitation и distribution shift. Даже хороший eval может не показать скрытую способность модели или не воспроизвести условия реального деплоя, где число пользователей, адаптивность атакующих и объём попыток на порядки выше.

Вывод

RSP, Preparedness Framework и FSF — это три разных интерфейса к одной задаче: не допустить, чтобы рост возможностей frontier-моделей опередил меры контроля. В 2024 году отрасль не пришла к единому стандарту, но уже оформила общий шаблон: пороги, evals, mitigations, governance, transparency и возможность паузы. Для инженеров и исследователей ценность здесь не в том, что спор закрыт, а в том, что спор стал гораздо более операционным.

Источники

FAQ

Это три конкурирующих стандарта?

Скорее три совместимых семейства практик. Они различаются по терминологии и governance-логике, но все строятся вокруг порогов риска, evals, mitigations и возможности остановить выпуск или развитие.

Почему в статье про 2024 фигурируют документы 2023 года?

Потому что публичная рамка OpenAI в 2024 году опиралась на beta-документ от 18 декабря 2023 года, а RSP Anthropic был запущен 19 сентября 2023 года и именно в 2024-м стал активно обсуждаться и уточняться. Это исторический обзор состояния рамок в 2024 году, а не список только тех PDF, которые впервые вышли между январём и декабрём 2024-го.

Можно ли считать наличие framework доказательством безопасности модели?

Нет. Framework — это процедура принятия решений и публикации аргументов, а не математическое доказательство. Его качество зависит от того, насколько хороши evals, насколько строги mitigations и насколько независим review.

Что из этих рамок полезно небольшой AI-команде?

Минимальный заимствуемый набор такой: заранее определить пороги недопустимого риска, привязать к ним обязательные меры, назначить владельца решения и предусмотреть право на остановку релиза. Даже без frontier-scale ресурсов эта логика полезна для агентных систем, tool use и high-risk enterprise deployments.

Читайте также