В 2024 году разговор о безопасности frontier-моделей сместился от общих принципов к публичным корпоративным рамкам: Anthropic развивала Responsible Scaling Policy (RSP), OpenAI применяла Preparedness Framework, а Google DeepMind 17 мая 2024 года представила Frontier Safety Framework (FSF). Исторически это не три полностью синхронных документа одного года: RSP был впервые опубликован 19 сентября 2023 года и уточнялся в 2024-м, beta-версия Preparedness Framework вышла 18 декабря 2023 года и использовалась в релизах 2024 года, а FSF стартовал как новый документ уже в мае 2024-го. Важно читать их не как набор общих обещаний, а как попытки превратить абстрактное «быть осторожнее» в операционные правила: что считать опасным порогом, как это мерить, кто принимает решение и когда нужно тормозить разработку или деплой.
Коротко
- RSP, Preparedness Framework и FSF — три варианта одной общей идеи: responsible capability scaling, то есть управления риском по мере роста возможностей модели.
- Главное различие — в единице решения. Anthropic строит политику вокруг уровней ASL и capability thresholds, OpenAI — вокруг категорий риска и итогового score, DeepMind — вокруг Critical Capability Levels и связанных уровней mitigations.
- Во всех трёх подходах есть одна и та же связка: thresholds → evaluations → mitigations → governance → возможность паузы.
- Публичная прозрачность различается. Anthropic подробнее описывает внутреннее управление и обязательства, OpenAI показывает scorecards в system cards, DeepMind сильнее акцентирует раннее предупреждение и лестницу мер безопасности.
- Слабое место у всех общее: наука dangerous capability evaluations ещё незрелая, а сами рамки в 2024 году оставались в основном добровольными корпоративными механизмами.
Контекст
Термины RSP, Preparedness и FSF появились не в пустоте. В октябре 2023 года британский документ Emerging Processes for Frontier AI Safety описал responsible capability scaling как один из базовых процессов для frontier AI: заранее определить пороги риска, привязать к ним конкретные меры, подготовить механизмы паузы и обеспечить внутреннюю подотчётность и внешнюю проверку. Уже 21 мая 2024 года на AI Seoul Summit компании, включая Anthropic, OpenAI и Google, публично согласились публиковать safety frameworks с порогами, mitigations, governance и прозрачностью.
Поэтому сравнивать RSP, Preparedness Framework и FSF лучше не как три несвязанных документа, а как три реализации одной архитектурной схемы. Для практиков это полезно: если вы строите eval-пайплайн, внутренний release review или policy для агентных систем, эти документы показывают, как крупные лаборатории переводят риск из уровня обсуждений в уровень процедур.
Метод
Anthropic: Responsible Scaling Policy
RSP версии 1.0, опубликованная 19 сентября 2023 года, изначально строилась вокруг AI Safety Levels (ASL), по аналогии с biosafety levels. Идея простая: при достижении более опасных capability thresholds лаборатория должна заранее перейти на более жёсткие меры безопасности, безопасности весов и правила деплоя. В документе прямо зафиксирована возможность остановить обучение или выпуск, если нужные меры ещё не готовы.
Для RSP характерны три черты. Во-первых, сильная связка между capability threshold и конкретным набором safeguards. Во-вторых, выделенная governance-роль: Responsible Scaling Officer, отчётность перед board и Long-Term Benefit Trust, а также обновление самой политики через формальный процесс. В-третьих, акцент на assurance: в майских Reflections on our Responsible Scaling Policy Anthropic отдельно пишет про stress-testing evals, внешнюю проверку и развитие «второй линии защиты». В крупном обновлении, объявленном 15 октября 2024 года, Anthropic также сместила политику в сторону более явных capability thresholds и подходов, вдохновлённых safety cases.
OpenAI: Preparedness Framework
Публичная beta-версия Preparedness Framework датирована 18 декабря 2023 года, а в 2024-м она стала видна прежде всего через system cards. Логика у OpenAI немного иная: вместо ASL-уровней используется набор tracked risk categories и итоговая оценка риска. В материалах 2024 года это категории cybersecurity, CBRN, persuasion и model autonomy.
Практический смысл framework у OpenAI — в decision rule. В GPT-4o System Card компания пишет, что модель с post-mitigation score выше «medium» не должна деплоиться, а модель выше «high» не должна продолжать развитие. Тем самым Preparedness работает как процедура допуска: сначала лаборатория проводит frontier evaluations, затем Safety Advisory Group рассматривает результаты и mitigations, после чего формируется решение о выпуске. Отдельная линия в этой конструкции — поиск «unknown unknowns»: её OpenAI описывала ещё в материале о команде Preparedness и challenge-программе.
Google DeepMind: Frontier Safety Framework
FSF версии 1.0 был представлен 17 мая 2024 года и сразу оформлен как отдельная рамка с техническим отчётом. Её базовая единица — Critical Capability Level (CCL): порог возможностей, после которого модель без дополнительных мер может создавать severe risk. В первой версии DeepMind рассматривала четыре домена: autonomy, biosecurity, cybersecurity и machine learning R&D.
Архитектура FSF трёхшаговая. Сначала лаборатория определяет CCL в риск-домене. Затем она запускает early warning evaluations, чтобы понять, приближается ли модель к этому порогу. После этого подбираются mitigations двух типов: security mitigations для защиты весов и deployment mitigations для ограничения злоупотребления критическими возможностями. В техническом отчёте DeepMind отдельно оговаривает, что если модель подходит к порогу, а адекватные меры ещё не готовы, дальнейший development или deployment должен быть поставлен на hold.
Результаты
Если свести три рамки к одной таблице, видно не только сходство, но и разные центры тяжести.
| Рамка | Публичная отправная точка | Единица порога | Домены риска в публичной версии 2024 | Что связывает eval с решением | Публичный артефакт |
|---|---|---|---|---|---|
| Anthropic RSP | RSP v1.0 — 19.09.2023; рефлексия внедрения — 20.05.2024; крупное обновление — 15.10.2024 | ASL и capability thresholds | Катастрофические риски; в 2024 особый акцент на CBRN и autonomous AI R&D | Переход к более жёстким ASL safeguards; при нехватке мер возможна пауза обучения или деплоя | Policy PDF, версия политики, reflections и дальнейшие update-notes |
| OpenAI Preparedness Framework | Beta — 18.12.2023; практическое применение публично видно в GPT-4o System Card от 08.08.2024 | Категории риска и итоговый score | Cybersecurity, CBRN, persuasion, model autonomy | Модели с post-mitigation score выше medium не деплоятся; выше high не должны продолжать развитие | Preparedness scorecards внутри system cards |
| Google DeepMind FSF | FSF v1.0 — 17.05.2024 | Critical Capability Levels и уровни mitigations | Autonomy, biosecurity, cybersecurity, ML R&D | Early warning evals и подбор security/deployment levels; при неготовых мерах — hold | Technical report и объясняющий blog post |
Общий паттерн у всех трёх один и тот же. Сначала лаборатория формулирует, какая способность или какой риск считаются недопустимыми без дополнительных мер. Затем пытается измерить приближение к этому порогу. Потом заранее описывает escalation path. И только после этого делегирует финальное решение какому-то governance-органу или роли.
Но различается то, что именно становится «объектом управления». У Anthropic это переход через capability threshold с заранее описанными safeguard standards. У OpenAI — остаточный риск после mitigations. У DeepMind — приближение к критическому capability level и соответствие нужному уровню security/deployment controls.
Интерпретация
Наш комментарий
На наш взгляд, эти документы важны не потому, что «доказывают безопасность», а потому, что задают форму разговора о ней. Они переводят вопрос из режима «модель кажется опасной» в режим «какой именно threshold сработал, какой eval это показал, какие mitigations обязаны включиться и кто отвечает за решение». Для инженерной организации это большой шаг вперёд, даже если сами thresholds пока спорны.
Ещё один важный сдвиг 2024 года — движение в сторону safety case-логики. Отдельная работа Safety Cases: How to Justify the Safety of Advanced AI Systems описывает safety case как структурированное обоснование того, что система вряд ли вызовет катастрофу. Этот язык уже просматривается в самих корпоративных рамках: Anthropic в обновлении 2024 года прямо пишет о методологиях, вдохновлённых safety cases, а DeepMind в FSF вводит deployment mitigation level, где фигурирует safety case с red team validation. То есть рынок постепенно сдвигается от «провели набор тестов» к «собрали структурированный аргумент о приемлемом остаточном риске».
Для практиков полезный вывод такой: лучший safety framework — не тот, где больше терминов, а тот, где у каждого threshold есть измерение, у каждого измерения есть владелец, у каждого владельца есть право остановить rollout, а у организации есть обязанность публично объяснить хотя бы часть логики. Именно эта связка, а не громкость формулировок, отличает рабочий governance-процесс от декларации.
Ограничения
- Это добровольные корпоративные рамки, а не независимая сертификация. Seoul commitments прямо называют такие обязательства voluntary, а сами компании оставляют за собой право обновлять документы по мере развития науки и внешней среды.
- Наука dangerous capability evaluations ещё незрелая. Anthropic в RSP v1.0 пишет, что дизайн таких evals — nascent area of research; DeepMind называет FSF exploratory and based on preliminary research; OpenAI тоже описывает Preparedness как living document.
- Пороги частично остаются качественными. Даже когда есть формальные названия уровней, остаётся трудный вопрос: какой именно результат eval действительно означает неприемлемый реальный риск, а какой — только ранний warning.
- Фокус узкий: severe или catastrophic risk, а не весь спектр harms. Эти документы не заменяют policy по bias, privacy, copyright, elections, labor impacts или product abuse. Обычно сами авторы прямо пишут, что framework лишь дополняет существующие safety practices.
- Публичной информации по исполнению меньше, чем по дизайну. Мы лучше видим структуру документов, чем то, как именно внутри компаний проверяется адекватность mitigations, как часто меняются thresholds и насколько независим внутренний review.
- Остаются риски under-elicitation и distribution shift. Даже хороший eval может не показать скрытую способность модели или не воспроизвести условия реального деплоя, где число пользователей, адаптивность атакующих и объём попыток на порядки выше.
Вывод
RSP, Preparedness Framework и FSF — это три разных интерфейса к одной задаче: не допустить, чтобы рост возможностей frontier-моделей опередил меры контроля. В 2024 году отрасль не пришла к единому стандарту, но уже оформила общий шаблон: пороги, evals, mitigations, governance, transparency и возможность паузы. Для инженеров и исследователей ценность здесь не в том, что спор закрыт, а в том, что спор стал гораздо более операционным.
Источники
- Emerging Processes for Frontier AI Safety
- Anthropic’s Responsible Scaling Policy, Version 1.0
- Reflections on our Responsible Scaling Policy
- Anthropic’s Responsible Scaling Policy
- Frontier Risk and Preparedness
- Preparedness Framework (Beta)
- GPT-4o System Card
- Introducing the Frontier Safety Framework
- Frontier Safety Framework, Version 1.0
- Evaluating Frontier Models for Dangerous Capabilities
- Frontier AI Safety Commitments, AI Seoul Summit 2024
- Safety Cases: How to Justify the Safety of Advanced AI Systems
FAQ
Это три конкурирующих стандарта?
Скорее три совместимых семейства практик. Они различаются по терминологии и governance-логике, но все строятся вокруг порогов риска, evals, mitigations и возможности остановить выпуск или развитие.
Почему в статье про 2024 фигурируют документы 2023 года?
Потому что публичная рамка OpenAI в 2024 году опиралась на beta-документ от 18 декабря 2023 года, а RSP Anthropic был запущен 19 сентября 2023 года и именно в 2024-м стал активно обсуждаться и уточняться. Это исторический обзор состояния рамок в 2024 году, а не список только тех PDF, которые впервые вышли между январём и декабрём 2024-го.
Можно ли считать наличие framework доказательством безопасности модели?
Нет. Framework — это процедура принятия решений и публикации аргументов, а не математическое доказательство. Его качество зависит от того, насколько хороши evals, насколько строги mitigations и насколько независим review.
Что из этих рамок полезно небольшой AI-команде?
Минимальный заимствуемый набор такой: заранее определить пороги недопустимого риска, привязать к ним обязательные меры, назначить владельца решения и предусмотреть право на остановку релиза. Даже без frontier-scale ресурсов эта логика полезна для агентных систем, tool use и high-risk enterprise deployments.
