Запись архива

Полностью открытые: что показали OLMo 2 и датасет Dolma

Разбираем, как AI2 связала открытый корпус Dolma, двухэтапное обучение OLMo 2 и публикацию всех артефактов — от данных и кода до чекпойнтов — и что это реально меняет для практиков.

Схема пайплайна OLMo 2: от открытого корпуса Dolma через OLMo Mix 1124 и Dolmino Mix 1124 к base- и instruct-версиям модели

AI2 анонсировала OLMo 2 26 ноября 2024 года, а основной технический отчёт arXiv:2501.00656 был подан 31 декабря 2024 года. Поэтому разбирать тему по первоисточникам удобнее как срез конца 2024 года: релизный пост даёт рамку, а техотчёт — детали рецепта.

Ключевая пара для чтения здесь — не только сама модель OLMo 2, но и Dolma, отдельный открытый корпус для pretraining. В этом и состоит главная идея работы: показать не «ещё одни открытые веса», а открытый стек целиком — данные, код, промежуточные чекпойнты, логи и eval-пайплайн.

Коротко

  • OLMo 2 важна не столько как релиз модели, сколько как редкий пример fully open-подхода: AI2 публикует не только веса, но и данные, код обучения, рецепты, логи и множество промежуточных чекпойнтов.
  • Dolma — это открытый английский корпус на 3 триллиона токенов из web, papers, code, books, Reddit и Wikipedia; он нужен как воспроизводимая база для исследований pretraining.
  • Сердце OLMo 2 — двухэтапное обучение: сначала большой pretraining mix примерно на 3.9 триллиона токенов, затем late-stage mid-training на Dolmino Mix 1124 объёмом 843 миллиарда токенов.
  • По цифрам самих авторов, заметная часть прироста приходит именно после mid-training: особенно на GSM8K, DROP и Natural Questions.
  • Для практиков главный урок такой: открытость полезна, когда открыты не только веса, но и точки вмешательства в пайплайн. Но это всё ещё не равняется независимой репликации и не делает воспроизведение дешёвым.

Контекст

Что здесь вообще значит «полностью открытая» модель

Вокруг LLM слово «open» часто означает только публикацию финального чекпойнта. Линия OLMo с самого начала задавала более жёсткий стандарт: в статье про первый OLMo AI2 прямо описывает выпуск весов, открытых обучающих данных, кода обучения и оценки, логов и промежуточных состояний обучения. Для исследователя это принципиальная разница: можно разбирать не только поведение готовой модели, но и происхождение этого поведения.

Именно поэтому Dolma здесь не приложение к модели, а центральный объект. Отчёт о Dolma начинается с довольно простой, но важной проблемы: лучшие LLM почти никогда не раскрывают состав pretraining-корпусов достаточно подробно, а значит трудно исследовать влияние данных на способности и ограничения модели.

Оговорка по датам

В редакторской подсказке стоит «AI2, 2024», и это верно как историческая рамка релиза. Но технический первоисточник по OLMo 2 — это уже арXiv-отчёт, поданный 31 декабря 2024 года; ниже я опираюсь на него как на основной документ и отдельно на отчёт о Dolma 2024 года.

Метод: как устроены OLMo 2 и Dolma

1. Dolma — открытый фундамент для pretraining

Dolma описана как открытый английский корпус на 3 триллиона токенов. В отчёте перечислены шесть основных классов источников: Common Crawl, GitHub, Reddit, Semantic Scholar, Project Gutenberg и Wikipedia/Wikibooks. Важна не только величина, но и то, что AI2 выпускает вместе с корпусом и toolkit для его сборки и анализа; это делает возможными повторяемые ablation-эксперименты над данными, а не только над архитектурой.

Для практиков здесь важны две детали. Во-первых, Dolma документирована как именно English corpus, то есть выводы из этой линии нельзя автоматически переносить на мультиязычные модели. Во-вторых, в апреле 2024 года AI2 перевела Dolma на лицензию ODC-BY, что упростило повторное использование корпуса и производных работ.

2. Первый этап OLMo 2: большой pretraining mix

Базовая модель OLMo 2 обучается в два этапа, причём первый съедает 90–95% вычислительного бюджета. На этой стадии AI2 использует OLMo Mix 1124 — смесь примерно из 3.9 триллиона токенов. По техотчёту, более 95% этого объёма происходят из web-данных; кроме них в смесь входят code из StarCoder, академические тексты и энциклопедические данные из Dolma, а также математические источники из Proof Pile II.

Это важный сдвиг относительно упрощённой картинки «всё решает один гигантский web corpus». OLMo 2 строится не на одной монолитной свалке текста, а на версии заранее смешанного и документированного data recipe. В релизной рамке конца 2024 года это были модели 7B и 13B; по материалам AI2, 7B дообучали примерно до 4 триллионов токенов, 13B — до 5 триллионов.

3. Второй этап: Dolmino как late-stage curriculum

Самая содержательная часть работы — не pretraining сам по себе, а следующий шаг. После первого этапа AI2 собирает Dolmino Mix 1124: отдельный пул на 843 миллиарда токенов, где high-quality web сочетается с instruction-данными, академическими текстами, энциклопедией, curated Q&A из Stack Exchange и отдельным math mix.

По таблице состава, крупнейшая часть Dolmino — это 752 миллиарда токенов высококачественного web-корпуса после дополнительной фильтрации. Дальше идут 58.6 миллиарда токенов академических текстов, 17 миллиардов instruction data, 1.26 миллиарда curated Q&A и 10.7 миллиарда math-данных. Из этого пула AI2 собирает отдельные смеси на 50, 100 и 300 миллиардов токенов для mid-training.

Здесь появляется и ещё одна нетривиальная техника: вместо одного прохода авторы запускают несколько mid-training-веток с разным порядком данных, а затем усредняют финальные чекпойнты. Для 7B это три прогона на 50B токенов; для 13B — три прогона на 100B и один на 300B. В отчёте это описано как model souping, и именно эта деталь делает OLMo 2 скорее инженерным рецептом, чем одной «магической» архитектурной идеей.

4. Что изменили в самом train recipe

Архитектурно OLMo 2 остаётся dense autoregressive transformer, но с рядом правок ради стабильности длинных запусков: RMSNorm вместо старого варианта нормализации, перестановка точки применения нормализации внутри блока, QK-Norm, rotary positional embeddings, z-loss и более консервативная инициализация. Отдельно AI2 фильтрует повторяющиеся n-граммы в данных и пишет, что именно такие последовательности часто коррелировали со spikes градиента и loss.

Это полезный практический сигнал: в OLMo 2 вклад в итоговый результат идёт не только от объёма данных, но и от скучной инженерии устойчивости. Авторы прямо связывают улучшение качества с уменьшением нестабильностей long-run training.

Результаты

Важно: точные числа в таблице ниже приведены по единственному детализированному первоисточнику — Table 9 техотчёта OLMo 2. Это авторские измерения AI2, а не независимая репликация.

Модель Этап Средний балл Natural Questions DROP GSM8K MMLU Pro
OLMo 2 7B После pretraining 53.0 29.0 40.7 24.1 27.4
OLMo 2 7B После mid-training 62.9 36.9 60.8 67.5 31.0
OLMo 2 13B После pretraining 58.9 34.6 49.6 37.3 31.2
OLMo 2 13B После mid-training 68.3 46.7 70.7 75.1 35.1

Даже если смотреть только на авторскую таблицу, картина понятна: Dolmino работает не как косметический финальный штрих, а как основной усилитель способностей. У 7B средний балл растёт с 53.0 до 62.9, а GSM8K — с 24.1 до 67.5. У 13B средний балл растёт с 58.9 до 68.3, а DROP — с 49.6 до 70.7.

Если перейти от внутрисемейного сравнения к внешнему, AI2 и в релизном посте, и в техотчёте описывает OLMo 2 7B/13B как конкурентные open-weight моделям сопоставимого класса, включая Llama 3.1 и Qwen 2.5, при полной прозрачности train stack. Это важная, но всё же авторская формулировка: она опирается на их eval-suite и их режим held-out задач.

Интерпретация

Наш комментарий

На наш взгляд, главный результат OLMo 2 не в том, что «открытая модель наконец догнала всех», а в другом: AI2 превратила открытость в объект инженерного дизайна. Здесь открыты не только веса, но и уровни, на которых можно вмешиваться в процесс: базовый корпус, pretraining mix, late-stage curriculum, промежуточные чекпойнты и post-training recipe.

Для практиков это означает, что OLMo 2 можно читать как карту решений. Dolma отвечает за широкий и воспроизводимый фундамент. Dolmino отвечает за целенаправленное late-stage усиление. Рецепт Tülu 3 отвечает за превращение base model в instruct-model. Такая декомпозиция полезнее для прикладной команды, чем абстрактный тезис «мы просто обучили лучше».

Второй важный вывод: в 2024 году данные уже недостаточно описывать одной цифрой «сколько триллионов токенов». OLMo 2 показывает многоступенчатый pipeline, где разные смеси решают разные задачи. Если вам нужен управляемый open stack, то открывать надо не только общий корпус, но и производные смеси по этапам обучения.

Ограничения и критика

  • Сильная сторона OLMo 2 — прозрачность артефактов; слабая — отсутствие независимой верификации ключевых таблиц внутри самого отчёта. Почти все точные результаты исходят от AI2.
  • Авторы специально держат часть eval-задач unseen для себя, но прямо пишут, что не могут гарантировать такой же режим для чужих моделей. Это делает внешние сравнения полезными, но не идеально симметричными.
  • Dolma документирована как английский корпус. Поэтому из неё нельзя честно выводить общие тезисы о мультиязычном pretraining.
  • Открытость не равна низкому порогу воспроизведения. На наш взгляд, AI2 сняла барьер непрозрачности, но не барьер стоимости: multi-trillion-token обучение остаётся ресурсно тяжёлым.
  • Dolmino включает не только high-quality web и papers, но и synthetic math/instruction data. Это повышает итоговые способности, но одновременно размывает границу между «чистым pretraining» и уже частично task-shaped обучением.

Вывод

OLMo 2 и Dolma важны прежде всего как демонстрация того, что fully open может означать не лозунг, а конкретный набор публикуемых артефактов. Главное техническое наблюдение из этой линии работ простое: крупный открытый корпус сам по себе ещё не даёт лучший результат; заметный выигрыш появляется, когда к нему добавляют документированный data curriculum, устойчивый train recipe и открытый post-training.

Если вы строите собственный стек, практический takeaway такой: открывайте и версионируйте не только модель, но и данные по стадиям обучения. Именно это делает рецепт анализируемым и переносимым.

Источники

FAQ

Что здесь открыто кроме весов?

В линии OLMo речь идёт о весах, обучающих данных, коде обучения и оценки, рецептах, логах и множестве промежуточных чекпойнтов. Именно это AI2 использует как более строгий смысл слова fully open.

Dolma и Dolmino — это одно и то же?

Нет. Dolma — базовый открытый корпус для pretraining. Dolmino — более узкая и более качественно отфильтрованная смесь для late-stage mid-training, собранная из high-quality web, academic, Q&A, instruction и math-источников.

Доказывает ли OLMo 2, что открытые модели уже догнали закрытые?

Нет, так говорить слишком широко. Для релиза конца 2024 года авторы показывают конкурентность 7B и 13B относительно части open-weight моделей на своей eval-suite; это не универсальное доказательство превосходства над закрытым фронтиром.

Почему эта работа важна для практиков, а не только для исследователей?

Потому что она даёт не только финальный checkpoint, но и разложенный по этапам recipe. Из него можно заимствовать структуру данных, подход к late-stage curriculum, идеи про стабильность обучения и логику разделения pretraining, mid-training и post-training.

Читайте также