Запись архива

OpenAI поддержала Appia Foundation в разработке общих стандартов для продвинутого ИИ

OpenAI сообщила о работе с Appia Foundation над общими подходами к оценке и безопасности продвинутых ИИ-систем. Пока у инициативы больше заявленных целей, чем опубликованных технических деталей.

Анонс OpenAI о поддержке общих стандартов оценки и безопасности продвинутых ИИ-систем
Анонс OpenAI о поддержке общих стандартов оценки и безопасности продвинутых ИИ-систем
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

OpenAI сообщила о поддержке Appia Foundation — инициативы, которая должна помочь сформировать общие стандарты для оценки и безопасной разработки продвинутых систем искусственного интеллекта. В публикации OpenAI среди направлений работы названы оценочные методики, практики безопасности и международное сотрудничество.

Для разработчиков и компаний существенен сам предмет инициативы: лаборатории пока используют разные тесты, определения рисков и форматы раскрытия результатов. Из-за этого отчёты о безопасности двух моделей сложно сопоставить напрямую, даже если обе компании заявляют о проведении red teaming и проверок перед выпуском.

При этом анонс нельзя считать готовым стандартом или запуском системы сертификации. В доступном описании не приведены технические спецификации, обязательные пороговые значения и порядок независимой проверки моделей.

Какие задачи заявлены для Appia Foundation

Основная идея Appia Foundation — создать общую основу, которой смогут пользоваться разработчики ИИ, исследователи и другие участники отрасли. Судя по формулировке OpenAI, работа должна охватывать как методы оценки возможностей моделей, так и практики управления связанными с ними рисками.

Единая оценочная система могла бы определить, какие свойства модели проверяются перед развёртыванием, как фиксируются результаты и при каких условиях требуется дополнительное тестирование. Для продвинутых моделей это может быть особенно актуально при оценке способности работать с внешними инструментами, выполнять многоэтапные задачи или действовать с ограниченным контролем человека.

Однако OpenAI пока не раскрыла состав конкретных тестов. Также не сообщается, будут ли методики Appia Foundation открытыми, кто сможет предлагать изменения и будут ли результаты испытаний публиковаться полностью. Поэтому сравнивать будущую систему с существующими стандартами пока рано.

Из анонса также не следует, что Appia Foundation получила регулирующие полномочия. Разработанные фондом документы могут стать добровольными отраслевыми рекомендациями, основой для аудита или материалом для регуляторов, но их юридический статус ещё не определён.

Чем общие оценки отличаются от привычных бенчмарков

Популярные тесты вроде MMLU или HumanEval измеряют отдельные способности модели: работу с вопросами из разных предметных областей или генерацию программного кода. Высокий результат в таком бенчмарке сам по себе не подтверждает безопасность системы.

Для оценки рисков требуется другой набор процедур. В него могут входить тестирование поведения в пограничных сценариях, проверка устойчивости защитных механизмов, анализ использования инструментов и исследование того, как модель реагирует на попытки обойти ограничения. Для агентных систем также имеет значение, способна ли модель самостоятельно продолжать цепочку действий после ошибки или неоднозначной команды.

Проблема в том, что лаборатории могут по-разному выбирать сценарии, уровни доступа и критерии успешного прохождения теста. Без общего протокола одинаковые термины в отчётах не гарантируют сопоставимости результатов.

Appia Foundation потенциально может сократить этот разрыв, если опубликует воспроизводимые процедуры, версии тестовых наборов и правила интерпретации показателей. Пока OpenAI обозначила направление работы, но не представила материалов, по которым можно проверить воспроизводимость будущих оценок.

Инициатива появляется рядом с уже действующими рамками

Appia Foundation начинает работу не с чистого листа. В отрасли уже существуют добровольные и государственные подходы к управлению рисками ИИ.

Американский Национальный институт стандартов и технологий опубликовал AI Risk Management Framework, который описывает процессы выявления, измерения и управления рисками. Это рамочный документ: он помогает организациям выстроить работу, но не сводит безопасность любой модели к одному универсальному результату.

Крупные разработчики передовых моделей также участвуют во Frontier Model Forum. Эта организация занимается вопросами безопасности наиболее мощных моделей, поддержкой исследований и обменом практиками между участниками. Поэтому Appia Foundation предстоит показать, какие задачи она решает иначе и как будет избегать дублирования уже существующих проектов.

В Европейском союзе действует отдельный регуляторный контур. Регламент ЕС об искусственном интеллекте устанавливает юридические требования для разных категорий систем, включая правила для моделей общего назначения. Добровольный технический стандарт может помочь компаниям выполнять отдельные требования, но не заменяет закон и не отменяет обязанности поставщика в конкретной юрисдикции.

Именно совместимость с такими рамками станет одним из критериев практической ценности Appia Foundation. Если фонд предложит ещё один набор терминов и отчётов без сопоставления с действующими требованиями, нагрузка на разработчиков может вырасти вместо ожидаемой унификации.

Чего пока нельзя утверждать

Публикация OpenAI подтверждает поддержку работы над общими стандартами, но не даёт оснований говорить о появлении отраслевой сертификации Appia. Не объявлены обязательные проверки, знак соответствия или процедура допуска моделей на рынок.

Также преждевременно считать будущие оценки полностью независимыми. Для этого необходимо знать структуру управления фондом, порядок финансирования, правила урегулирования конфликтов интересов и роль внешних исследователей. Эти детали особенно существенны, если разработчики моделей одновременно участвуют в создании критериев их оценки.

Нет и опубликованного графика выпуска спецификаций. Пока неизвестно, появятся ли сначала общие принципы, технические тесты или процедуры аудита. Без таких документов невозможно определить, охватит ли работа только крупные закрытые модели или также открытые модели, специализированные системы и ИИ-агентов.

Что отслеживать разработчикам и заказчикам ИИ

Практическая проверка инициативы начнётся после публикации первых документов. Разработчикам стоит смотреть не на само участие известных компаний, а на несколько конкретных признаков:

  • доступны ли тестовые протоколы и критерии прохождения;
  • указаны ли версии моделей, окружение и предоставленные им инструменты;
  • можно ли воспроизвести результаты вне лаборатории разработчика;
  • разделены ли оценки возможностей, надёжности и безопасности;
  • предусмотрена ли проверка независимой стороной;
  • сопоставлены ли требования с NIST AI RMF и законодательством ЕС;
  • распространяются ли методики на агентные системы и длительные автономные задачи.

До появления этих материалов анонс Appia Foundation следует воспринимать как заявление о направлении совместной работы, а не как доказательство того, что единый стандарт безопасности продвинутого ИИ уже создан или принят отраслью.

Источники