Запись архива

Почему open weights — это не open source: спор об определении

Разбираем спор вокруг термина open source в ИИ на исторической рамке OSAID 1.0 от OSI: почему открытые веса не равны открытой системе и что именно нужно для реальной модифицируемости.

Диаграмма, сравнивающая open weights, частичную открытость и open source AI по критериям OSI: данные, код, веса и права на модификацию

28 октября 2024 года Open Source Initiative выпустила Open Source AI Definition 1.0 — попытку аккуратно перенести язык open source в мир машинного обучения. Самый заметный тезис документа звучит жёстко, но полезно для практики: публикация весов модели сама по себе не делает систему open source.

Этот спор не сводится к терминологии. От него зависят воспроизводимость исследований, юридические права пользователей, качество аудита и то, насколько честно разработчики описывают степень открытости своих релизов.

Коротко

  • В классическом понимании OSI open source — это не просто доступ к артефакту, а право использовать, изучать, изменять и распространять систему.
  • В OSAID 1.0 для AI этого недостаточно одними весами: нужен «предпочтительный вид для модификации», включающий сведения о данных, полный код обучения и запуска, а также параметры.
  • Термин open weights обычно означает, что веса можно скачать. Но сам по себе он почти ничего не говорит о данных, обучающем пайплайне и лицензионных ограничениях.
  • На официальных примерах это видно особенно хорошо: релиз Meta Llama 3.1 от 23 июля 2024 года сопровождается кастомной лицензией и дополнительными условиями, тогда как OLMo от Ai2, выпущенная 1 февраля 2024 года, прямо заявляет публикацию данных, кода, весов и оценочных артефактов.

Контекст: почему вообще возник спор

В обычном софте слово open source давно означает больше, чем «можно посмотреть исходники». В The Open Source Definition OSI отдельно подчёркивает, что открытость включает право на перераспространение, модификацию и отсутствие дискриминации по области применения. Иными словами, открыть чтение файла недостаточно: важны ещё и права, и форма, в которой систему реально можно менять.

С моделями машинного обучения всё сложнее. Веса — важнейший артефакт, но не единственный. Если у вас есть только конечные параметры, но нет ясной информации о данных, коде обучения, фильтрации, токенизации, промежуточных настройках и условиях лицензии, вы можете локально запускать модель, но не обязательно можете полноценно изучать, воспроизводить и форкать систему.

Именно на этот разрыв указывали исследователи ещё до OSAID. Работы Андреаса Лизенфельда, Алианды Лопес и Марка Дингемансе, а затем Лизенфельда и Дингемансе, показывали, что «открытость» генеративных моделей распадается на несколько измерений: веса, код, данные, документацию, доступ и правовой режим. На этом фоне OSI попыталась дать не журналистскую, а операциональную дефиницию.

Метод: как OSAID разводит open weights и open source AI

Логика OSAID начинается не с файлов, а со свобод пользователя. По версии OSI, открытая AI-система должна позволять использовать её для любой цели, изучать её устройство, модифицировать и делиться ею с изменениями или без них. Это прямое продолжение логики классического open source, но адаптированное к ML-системам.

Ключевой термин здесь — preferred form to make modifications, то есть форма, в которой систему действительно можно менять. Для машинного обучения OSAID 1.0 перечисляет три обязательных блока:

  • Data Information — достаточно подробные сведения о данных, чтобы квалифицированный специалист мог собрать существенно эквивалентную систему.
  • Code — полный исходный код, использованный для обучения и запуска системы, включая обработку и фильтрацию данных, параметры обучения, инференс и архитектуру.
  • Parameters — сами параметры модели, то есть веса и иные конфигурационные настройки.

Отсюда и следует главная развилка. Если релиз даёт только параметры или в лучшем случае параметры плюс часть инференс-инфраструктуры, это ещё не эквивалентно open source AI в терминах OSI. Это может быть полезный и ценный релиз, но обещание у него уже другое.

Метка релиза Что обычно открывается Что не гарантируется Как это читать
Open weights Скачиваемые веса, иногда model card и код инференса Полный обучающий код, сведения о данных, свобода перераспространения без дополнительных условий Частичная открытость, удобная для запуска и дообучения, но не тождественная open source
Open Source AI по OSAID 1.0 Сведения о данных, полный код train/run, параметры и подходящие правовые условия Не обещает отсутствие рисков или идеальную документацию всего мира Нормативный минимум OSI для честной маркировки «open source AI»
Градиентная оценка по MOF Классы открытости от минимально полного релиза до наиболее полного Бинарный ярлык «открыто/закрыто» Полезна там, где нужно сравнивать степень полноты релиза, а не только его лозунг

Здесь важно не перепутать два разных вопроса. Первый: «можно ли скачать и использовать модель у себя?» Второй: «достаточно ли открыты артефакты и права, чтобы систему можно было воспроизвести, проверить и модифицировать без отдельного разрешения?» Open weights часто отвечает «да» на первый вопрос и «не обязательно» на второй.

Результаты: что видно на официальных релизах

Если применить эту рамку к реальным проектам, различие становится не теоретическим, а довольно практическим.

Проект Что прямо заявлено в официальных материалах Правовой режим Что это показывает
Meta Llama 3.1 Meta объявила публичный релиз 23 июля 2024 года; model card фиксирует ту же дату и называет лицензию кастомной коммерческой Llama 3.1 Community License требует атрибуции и вводит дополнительные условия для очень крупных сервисов Публичная доступность весов ещё не равна классической OSI-логике открытого исходного кода
Ai2 OLMo Ai2 объявила релиз 1 февраля 2024 года; блог и статья описывают публикацию training data, training/evaluation code, weights, checkpoints и logs По словам Ai2, код, веса и промежуточные чекпойнты выпущены под лицензией Apache Это уже ближе к «предпочтительной форме для модификации», потому что открыт не только конечный артефакт

Отдельно полезно посмотреть на альтернативную рамку Model Openness Framework. Авторы MOF предлагают не спорить только о слове open, а оценивать полноту релиза по нескольким обязательным компонентам и относить проекты к одному из трёх классов. Для инженерной практики это удобно: вместо бинарного спора появляется чек-лист того, что именно опубликовано по ходу жизненного цикла модели.

Интерпретация

Наш комментарий

Самая полезная часть спора состоит в том, что он возвращает технический смысл словам. Когда компания говорит «модель открыта», разработчику стоит сразу уточнять: открыто что именно — веса, код инференса, обучающие скрипты, дата-пайплайн, лицензия на форки, документация, оценочные данные?

Для многих прикладных задач open weights вполне достаточно. Если вам нужен локальный запуск, контроль над приватностью запросов, дешёвое дообучение под свой домен или офлайн-инференс, скачиваемые веса уже дают большую практическую ценность. Проблема возникает тогда, когда релиз начинают называть open source без оговорок и тем самым обещают более сильную форму проверяемости и модифицируемости, чем дают фактически.

Из этого следует простой рабочий тест. Перед тем как повторять за производителем ярлык «open source», проверьте:

  1. Доступны ли веса без индивидуального согласования?
  2. Есть ли полный код обучения и запуска, а не только пример инференса?
  3. Есть ли достаточно подробная информация о данных и их происхождении?
  4. Можно ли распространять модифицированную систему без дополнительных переговоров?
  5. Нет ли специальных ограничений, которые ломают общую логику OSI, например отдельного режима для части пользователей?

Если хотя бы на часть этих вопросов ответ отрицательный или неясный, аккуратнее говорить не «open source», а «open weights», «weights available» или «частично открытый релиз». Это не уничижительный ярлык, а просто более точное описание.

Ограничения и критика

У позиции OSI есть и слабые места. Во-первых, OSAID 1.0 — это не закон природы, а нормативное определение конкретной организации. Оно влиятельно, потому что OSI исторически задаёт рамку для open source, но это всё равно не единственный возможный способ описывать открытость в AI.

Во-вторых, сама OSI признаёт, что вопрос данных в AI не решается так же просто, как вопрос исходников в софте. Поэтому в определении появился компромисс: не всегда требуются сами сырые датасеты, но требуются достаточно подробные сведения о данных. Для одних это реалистичный минимум, для других — уже уступка, размывающая идеал полной открытости.

В-третьих, критики бинарных определений правы в одном важном пункте: открытость моделей действительно градиентна. MOF поэтому и предлагает ступенчатую схему, а не один рубильник «open/closed». В некоторых случаях модель может быть очень полезной для науки и индустрии, даже если не дотягивает до максимальной полноты релиза.

Наконец, есть юридическая неопределённость вокруг самих параметров модели. OSAID прямо пишет, что для параметров пока не зафиксирован единственный обязательный правовой механизм и что ясность здесь может появиться позже, по мере развития практики и права. Это честная оговорка, но она означает, что спор о границах open source AI вряд ли завершён окончательно.

Вывод

Главная мысль OSAID 1.0 проста: веса — это только один слой системы. Если релиз не даёт достаточных сведений о данных, полного кода и прав на модификацию и распространение, называть его open source в классическом смысле слишком смело.

Для практиков отсюда следует удобная эвристика. Если вам нужен локальный запуск, ищите open weights. Если вам нужна воспроизводимость, аудит и реальная форкаемость, проверяйте релиз по более строгой рамке OSAID или хотя бы по чек-листу MOF.

Источники

FAQ

Можно ли называть модель open source, если её веса можно скачать?

Не автоматически. В логике OSAID этого недостаточно: нужны ещё права на использование, изучение, модификацию и распространение, а также сведения о данных и полный код.

Почему веса сами по себе не считаются «исходником» модели?

Потому что для содержательной модификации ML-системы часто недостаточно конечных параметров. Нужны ещё данные, пайплайн обработки, обучающие настройки, архитектурный код и правовой режим публикации.

Open weights — это плохо?

Нет. Для локального запуска, приватности, офлайн-инференса и прикладного fine-tuning это может быть очень полезный формат. Просто он обещает меньше, чем полноценный open source AI.

Какой минимальный практический чек-лист перед использованием слова «open source»?

Проверьте наличие весов, полного train/run-кода, подробной информации о данных и отсутствие специальных ограничений на перераспространение или модификацию.

Читайте также