Запись архива

International AI Safety Report: где есть консенсус, а где спор

Первый International AI Safety Report от 29 января 2025 года — это не манифест о «судьбе человечества», а карта научных согласий и разногласий о рисках ИИ общего назначения. Разбираем, что в нём действительно установлено.

Схема структуры International AI Safety Report 2025: происхождение отчёта, дедлайн источников, три аналитических блока и отдельная записка о событиях после 5 декабря 2024 года

29 января 2025 года вышел первый полноформатный International AI Safety Report — международный обзор научных знаний о безопасности ИИ общего назначения (general-purpose AI), подготовленный под председательством Yoshua Bengio. Это не новостной релиз и не набор готовых регуляторных рецептов: 96 экспертов свели литературу о возможностях моделей, классах рисков и методах снижения риска.

Главная ценность отчёта в другом: он аккуратно показывает, где у исследовательского сообщества уже есть рабочее согласие, а где остаются принципиальные разногласия. Ниже мы разбираем именно редакцию от 29 января 2025 года; основной корпус источников в ней ограничен работами, опубликованными до 5 декабря 2024 года, а более поздние события вынесены в отдельную записку председателя.

Коротко

  • Это не policy-манифест. Сам отчёт прямо говорит, что его задача — дать научную базу для информированного policymaking, а не рекомендовать конкретные меры.
  • Самый сильный консенсус — по текущим и ближним рискам. Речь о вреде от фейкового контента, мошенничестве, проблемах надёжности, bias и росте возможностей для киберзлоупотребления.
  • По дальним сценариям согласия меньше. Авторы фиксируют широкий разброс мнений о темпе прогресса и о вероятности сценариев loss of control в ближайшие годы.
  • Ключевой практический вывод — не искать «одну волшебную защиту». В отчёте упор сделан на системную безопасность, многослойные меры и мониторинг на уровне всей системы, а не только самой модели.
  • Для практиков это полезнее всего как карта рисков и пробелов в доказательствах. Документ хорошо отвечает на вопрос «что уже известно», но заметно хуже — на вопрос «какую именно политику надо принять завтра».

Контекст: зачем вообще понадобился International AI Safety Report

История отчёта начинается не в январе 2025-го, а в ноябре 2023 года, после AI Safety Summit в Блетчли-парке. Затем был промежуточный выпуск 17 мая 2024 года, а полный отчёт представили перед AI Action Summit во Франции в феврале 2025-го. Эта хронология важна: документ задуман как международная научная «база отсчёта», а не как реакция на один конкретный релиз модели.

В самом отчёте задача сформулирована узко и полезно: собрать научные данные по трём вопросам. Что умеет ИИ общего назначения сейчас и в ближайшем будущем; какие риски с этим связаны; какие технические и системные подходы могут эти риски уменьшать. При этом авторы отдельно оговаривают, что отчёт не рекомендует конкретную политику и не пытается полноценно описать все социальные эффекты и все потенциальные выгоды ИИ.

Это отличает документ от обычной публичной дискуссии о «безопасности ИИ», где рядом оказываются очень разные темы: от prompt injection и галлюцинаций до биооружия, рынка труда и потери контроля. Отчёт не смешивает их в одну страшилку, а раскладывает по типам риска и по силе имеющихся свидетельств.

Метод: как собран отчёт и что здесь считается «консенсусом учёных»

Полный выпуск от 29 января 2025 года написан группой из 96 экспертов. В него вошли авторы, научные советники и международная экспертная панель, номинированная 30 странами, а также OECD, EU и UN. Отдельно важно, что в отчёте зафиксирована независимость содержания: эксперты, по формулировке самих авторов, имели полное усмотрение в отношении текста.

Корпус литературы закрыт датой 5 декабря 2024 года. Это не формальность. Например, председательская записка отдельно объясняет, что результаты ранних тестов OpenAI o3 появились уже после завершения основного периода написания и потому должны читаться как постскриптум к отчёту, а не как его основа.

Ещё один важный методологический момент: авторы прямо признают, что поле развивается слишком быстро, и поэтому не все использованные материалы являются peer-reviewed. Но они заявляют фильтр на «high-quality sources»: оригинальный вклад, добросовестная работа с литературой, прозрачность метода и признание ограничений.

Поэтому слово «консенсус» здесь не означает ни голосование, ни единый прогноз, ни отсутствие споров. Скорее это трёхслойная конструкция:

  • Установленные факты и уже наблюдаемый вред.
  • Растущие, но ещё неполные свидетельства.
  • Темы с реальным научным несогласием и пробелами в данных.

Именно в этом виде отчёт и полезен: он не обещает закрыть спор, а честно показывает его структуру.

Результаты: где есть согласие, а где спор

Если читать документ глазами практика, его выводы удобно свернуть в одну рабочую таблицу.

Тема Что фиксирует отчёт Статус знания Практический смысл
Возможности моделей Способности ИИ общего назначения росли быстро; дальнейший темп может быть от медленного до очень быстрого Согласие о быстром прогрессе, спор о темпе следующего шага Нельзя строить безопасность на одном прогнозе скорости развития
Злоупотребление Фейковый контент, мошенничество и часть киберрисков уже реальны; по влиянию на общественное мнение данных меньше; биориски усиливаются, но оценка неполна От установленных случаев до растущих свидетельств Нужны меры и для текущего вреда, и для редких, но тяжёлых сценариев
Сбои и надёжность Ненадёжные ответы и bias уже создают вред в высокозначимых задачах Сильный консенсус Проблема не только в «враждебных» атаках, но и в обычной эксплуатации продукта
Loss of control Текущие системы не обладают возможностями, достаточными для meaningful risk активной потери контроля; по ближайшим годам мнения резко расходятся Согласие о настоящем, спор о будущем Нужны и исследования, и подготовка, но без утверждений о предрешённости сценария
Снижение риска Единственной надёжной меры нет; полезны системная безопасность, defence in depth, мониторинг, интервенции и человек в контуре Рабочий, но ещё незрелый набор подходов Безопасность надо проектировать на уровне всей цепочки разработки и использования

1. Возможности: быстрый прогресс — да, единый прогноз — нет

По первой части у отчёта довольно ясная позиция. Авторы считают, что возможности ИИ общего назначения заметно выросли за последние годы и уже охватывают широкий набор задач: разговор, программирование, работу с изображениями и видео, резюмирование длинных документов и другие функции. Но следом идёт важное ограничение: по темпу будущего прогресса единой позиции нет. В тексте прямо сказано, что дальнейшие улучшения в ближайшие месяцы и годы могут быть чем угодно — от медленных до чрезвычайно быстрых.

Для практиков это важнее, чем кажется. Отчёт не предлагает комфортного «среднего сценария», на который можно опереться при планировании. Он говорит обратное: системам управления риском нужно выдерживать широкий диапазон траекторий развития, а не только базовый прогноз.

Именно поэтому председательская записка о периоде между 5 декабря 2024 года и публикацией отчёта так существенна. В ней отдельно отмечены ранние результаты OpenAI o3 как событие, которое может указывать на сохранение высокого темпа capability progress, но при этом на момент выхода отчёта не сопровождалось достаточной публичной информацией о реальных полевых возможностях модели. Это хороший пример того, как сам документ различает «сигнал о росте» и «доказанное поведение в мире».

2. Злоупотребление: часть вреда уже не гипотетическая

Самая сильная часть отчёта — не споры о далёком будущем, а трезвое описание уже наблюдаемого вреда. В разделе о malicious use авторы выделяют целевые фейковые материалы, включая non-consensual deepfakes, голосовую имитацию для финансового мошенничества, шантаж и репутационный вред. Здесь акцент простой: некоторые типы ущерба уже материализовались, и задача состоит не в том, чтобы спорить, возможны ли они вообще, а в том, как их ограничивать.

С манипуляцией общественным мнением картина сложнее. Отчёт признаёт, что ИИ упростил массовую генерацию убедительного контента, но одновременно подчёркивает: данных о распространённости и реальной эффективности таких кампаний пока мало. Это показательная честность документа. Он не говорит «угроза надумана», но и не делает вид, будто уже есть твёрдые эмпирические выводы о масштабном политическом эффекте.

В кибербезопасности позиция осторожно тревожная. Текущие системы, по сводке отчёта, уже демонстрируют способности в задачах низкой и средней сложности, релевантных offensive security. При этом ключевой исследовательский вопрос остаётся открытым: изменит ли это баланс в пользу атакующих или защитники смогут встроить ИИ в оборонительные процессы не хуже.

С биологическими и химическими рисками тон ещё более аккуратный. Авторы признают, что современные general-purpose AI-системы уже проявляли способность давать инструкции и помогать с troubleshooting в направлении известных био- и химических угроз, а также поддерживать работу с новыми токсичными соединениями. Но тут же добавляют важное ограничение: для реального воплощения таких угроз всё ещё нужны дополнительные ресурсы, инфраструктура и экспертиза, а часть релевантных исследований остаётся закрытой. Иначе говоря, сигнал есть, но это ещё не повод изображать ситуацию как полностью понятую.

3. Сбои: надёжность и bias — это не «мелкие баги», а самостоятельный класс риска

Во многих публичных дискуссиях безопасность ИИ сводят либо к злонамеренному использованию, либо к экстремальным сценариям потери контроля. Отчёт полезно возвращает в кадр третий блок: вред от обычных сбоев. Авторы прямо пишут, что текущие general-purpose AI-системы могут быть ненадёжными, а пользователи часто не осознают ограничения продукта — из-за слабой AI literacy, вводящего в заблуждение маркетинга или банального непонимания того, что система на самом деле умеет.

На практике это означает следующее: если пользователь спрашивает модель о медицине, праве, финансах или другой high-stakes области, то ложный, но уверенно поданный ответ уже сам по себе является safety-проблемой, даже если никто никого специально не атаковал.

С bias формулировки тоже довольно жёсткие. Отчёт относит его к текущим рискам и перечисляет конкретные измерения: раса, гендер, культура, возраст, disability, политические взгляды и другие аспекты человеческой идентичности. Отдельно оговаривается, что методы смягчения bias развиваются, но почти всегда упираются в trade-off с другими целями — точностью, privacy и не только.

4. Loss of control: главное согласие здесь — не о будущем, а о настоящем

Наверное, самый обсуждаемый фрагмент отчёта — раздел о loss of control. И здесь полезно отделить две мысли, которые часто смешивают. Первая: у авторов есть широкое согласие, что текущие general-purpose AI-системы не обладают возможностями, достаточными для meaningful risk активной потери контроля. Вторая: по вероятности таких сценариев в ближайшие несколько лет у экспертов нет единой позиции.

Отчёт описывает этот разброс предельно прямо: часть экспертов считает такие сценарии неправдоподобными, часть — вероятными, часть — риском умеренной вероятности, который заслуживает внимания из-за потенциальной тяжести последствий. Это, пожалуй, и есть лучший пример того, как документ работает с консенсусом: он не сглаживает конфликт, а фиксирует, где именно он начинается.

Для практиков отсюда следует осторожный, но важный вывод. Если вы строите процессы оценки риска, бессмысленно вести себя так, будто вопрос о потере контроля уже закрыт в любую сторону. Корректнее считать его contested risk: недостаточно подтверждённым для категорических выводов, но достаточно серьёзным для исследований, стресс-тестов и подготовительной работы.

5. Системные риски: рынок труда, концентрация, экология и правовая неопределённость

Отдельная сильная сторона отчёта — включение системных эффектов в один аналитический кадр с техническими и злоумышленными рисками. Сюда авторы относят рынок труда, глобальный разрыв в AI R&D, рыночную концентрацию и single points of failure, экологические эффекты, privacy и copyright.

Здесь тон почти везде один и тот же: риск реален, но количественно и причинно он описан неодинаково хорошо. Например, по рынку труда отчёт не делает грубого вывода вида «ИИ массово уничтожит работу» или «ничего не произойдёт». Вместо этого он подчёркивает, что итог будет зависеть от скорости развития capabilities, масштаба внедрения и того, как изменится спрос на человеческий труд.

Особенно практичен раздел о концентрации. Если критические отрасли массово опираются на небольшой набор моделей и поставщиков, то уязвимость одной системы может становиться уязвимостью сразу многих организаций. Это уже не вопрос «умна ли модель», а вопрос архитектуры зависимости, supply chain и организационной устойчивости.

6. Что делать: системная безопасность, многослойная защита и мониторинг

В третьей части отчёт переходит к risk management. Его главный тезис звучит просто: технические методы существуют, но они ещё незрелы и имеют ограничения. Авторы отдельно подчёркивают, что interpretability, оценка реальной надёжности и подтверждение эффективности мер в полевых условиях пока далеки от зрелости.

Зато довольно ясно очерчивается рабочая рамка. Во-первых, отчёт рекомендует мыслить через system safety: не только модель, но и данные, интерфейс, организационные процессы, человеческий надзор и контекст развёртывания. Во-вторых, он выделяет стратегию defence in depth — многослойную защиту, где отказ одной меры не должен означать отказ всей системы. В-третьих, важную роль играют monitoring and intervention: контроль входов, выходов и поведения системы уже на этапе эксплуатации, а не только во время обучения.

Есть и важная организационная оговорка: усилия по управлению риском, как пишет отчёт, заметно различаются между ведущими AI-компаниями, а многие механизмы ещё не валидированы, не стандартизированы и не получили широкого распространения. То есть речь идёт не о solved problem, а скорее о строительстве дисциплины.

Отдельно полезен баланс в разделе об open-weight моделях. Документ не занимает простую позицию «открытость опасна» или «открытость всегда полезна». С одной стороны, если веса модели утекли или опубликованы, полного rollback фактически не существует. С другой — открытость позволяет большему числу исследователей и разработчиков находить дефекты и предлагать исправления. Для практики это означает, что вопрос open-weight release нельзя решать лозунгом; его надо разбирать через конкретные marginal risks и marginal benefits.

Интерпретация: что это значит для практиков

Наш комментарий

На наш взгляд, важнейший вклад отчёта не в том, что он «доказал» какую-то одну большую теорию риска, а в том, что он навёл порядок в самом споре. После него сложнее всерьёз утверждать, будто безопасность ИИ — это только про гипотетический AGI-сценарий, или наоборот будто всё сводится к галлюцинациям и prompt injection. Документ показывает более неприятную, но более реалистичную картину: портфель рисков разнотипен, а качество доказательств по этим рискам неравномерно.

Для продуктовых и инженерных команд из этого следует три прикладных вывода. Первый: классифицируйте свой риск не по бренду модели, а по режиму использования — high-stakes advice, autonomous tooling, code generation, массовая генерация контента, доступ к чувствительным данным и так далее. Второй: не путайте выравнивание модели с безопасностью системы. Даже если модель стала «послушнее», остаются вопросы интерфейса, прав доступа, журналирования, escalation path и человеческого надзора. Третий: стройте процессы так, чтобы они выдерживали и сегодняшние сбои, и возможное ускорение capabilities, не опираясь на один любимый прогноз.

Практически это очень близко к мысли из отчёта о defence in depth. В 2025 году разумный safety stack — это не одна техника, а слои: предрелизные оценки, ограничения доступа, мониторинг поведения, incident response, процедуры disclosure, человек в контуре для критических решений и честная коммуникация ограничений пользователю.

Ограничения и критика

  • Это исторический срез, а не «вечный» итог науки. Полный отчёт опубликован 29 января 2025 года, но основной корпус литературы в нём заканчивается 5 декабря 2024 года. Всё, что произошло после, включая заметные модельные анонсы, относится уже к периоду после дедлайна.
  • Покрытие намеренно неполное. Авторы сами ограничивают фокус general-purpose AI и не берутся полноценно оценивать все возможные выгоды, все типы ИИ и все социальные последствия их внедрения.
  • Не вся база peer-reviewed. Для быстро движущейся области это разумно, но это же означает неравномерное качество эмпирики и более высокий риск будущих пересмотров.
  • Отчёт силён как карта доказательств, но слабее как руководство к действию. Он сознательно не рекомендует конкретную политику. Для научного документа это плюс; для чиновника или руководителя, которому нужен список конкретных мер, — ограничение.
  • По ряду самых громких тем реальных данных всё ещё мало. Это касается как минимум массового влияния AI-персвазивности на общественное мнение, части биорисков и точного масштаба трудовых эффектов.
  • Есть и содержательная внешняя критика. В ответе Roel Dobbe указывается, что доминирующая техническая рамка AI safety может сужать разговор и недоучитывать полноценную системную безопасность как социотехническую дисциплину. Это не отменяет ценности отчёта, но напоминает, что даже очень большой международный обзор не закрывает вопрос о правильной рамке безопасности целиком.

Вывод

Если сжать International AI Safety Report до одного тезиса, он будет таким: научный консенсус в январе 2025 года существовал не вокруг одной драматической истории о будущем ИИ, а вокруг более прозаичной и полезной картины. Текущие harms уже реальны; некоторые тяжёлые сценарии требуют подготовки; а самый большой спор касается темпа прогресса и вероятности экстремальных исходов.

Поэтому читать этот отчёт лучше не как «приговор» и не как «опровержение тревог», а как baseline для серьёзного разговора. Он хорошо показывает, что именно мы уже знаем, чего пока не знаем и где инженерная практика может действовать до того, как научный спор окончательно завершится.

Источники

FAQ

Это официальный межправительственный документ или независимый обзор?

И то и другое, но в разных смыслах. Проект поддержан 30 странами и международными организациями, однако сам текст, по формулировке отчёта, написан независимыми экспертами, которые имели полное усмотрение в отношении содержания.

Говорит ли отчёт, что нынешние модели уже могут выйти из-под контроля?

Нет. В январской версии 2025 года есть широкое согласие, что текущие general-purpose AI-системы не имеют возможностей, достаточных для meaningful risk активной потери контроля. Спор идёт о том, что может произойти в ближайшие несколько лет, если capabilities будут расти быстро.

Что отчёт считает уже установленным классом риска?

Прежде всего вред от фейкового контента, мошенничества и части злоупотреблений, а также риски от ненадёжности и bias. То есть существенная доля safety-проблем уже находится не в гипотетическом будущем, а в текущем использовании систем.

Почему в разборе так важна дата 5 декабря 2024 года?

Потому что это дедлайн основного корпуса литературы для полного отчёта. Всё, что появилось позже, включая заметные анонсы новых моделей, нужно читать как отдельное обновление контекста, а не как часть исходной доказательной базы документа.

Читайте также