Запись архива

Phi-3 и Phi-4: как Microsoft усиливает маленькие модели данными

Разбор Phi-3 и Phi-4 от Microsoft: как отбор данных, синтетические «учебниковые» корпуса и постобучение помогли маленьким моделям прибавить в математике, коде и QA.

Схема пайплайна Phi-3 и Phi-4: фильтрация публичных данных, синтетические учебниковые примеры, post-training и сравнение результатов на MMLU, GPQA, MATH и HumanEval

Серия Phi — удобный кейс для вопроса, насколько далеко можно уехать не на росте числа параметров, а на качестве данных. В этом разборе мы сознательно ограничиваемся релизами 2024 года: Phi-3, представленной 23 апреля 2024 года, и Phi-4, технический отчёт по которой Microsoft опубликовала 12 декабря 2024 года. Главная линия обеих работ одна и та же: маленькие и средние модели можно заметно усилить за счёт жёсткого отбора корпуса, синтетических «учебниковых» данных и аккуратного постобучения.

Коротко

  • Phi-3 и Phi-4 — не история про «ещё больше параметров», а история про качество обучающих данных и тренировочный рецепт.
  • Для Phi-3 в technical report и на странице Microsoft Research указаны размеры 3,8B, 7B и 14B; для Phi-4 в technical report и model card указан размер 14B.
  • Microsoft последовательно использует смесь тщательно отфильтрованных публичных данных и синтетических «textbook-like» примеров; для Phi-4 авторы отдельно подчёркивают, что синтетика используется на всём протяжении обучения.
  • По данным technical report Phi-4 и официального model card, при сопоставимом размере с Phi-3-medium 14B модель Phi-4 заметно лучше на MMLU, GPQA, MATH, MGSM, HumanEval и DROP, но хуже на SimpleQA.
  • Практический вывод не в том, что архитектура перестала быть важной, а в том, что в классе компактных dense-моделей запас в данных, curriculum и post-training может быть очень большим.

Контекст

Идея серии Phi выросла не из попытки повторить фронтирные модели в уменьшенном масштабе, а из более старого тезиса Microsoft: не все токены одинаково полезны. В работе Textbooks Are All You Need исследователи показали, что маленькую модель можно заметно усилить, если кормить её не средним вебом, а более «педагогичным» распределением данных: объяснениями, задачами, упражнениями и синтетическими примерами, похожими на учебник.

Phi-3 — это уже зрелая инженерная версия этой линии. В technical report и на странице Microsoft Research указано, что семейство включает модели на 3,8B, 7B и 14B параметров. В анонсе Azure от 23 апреля 2024 года и в model card для Phi-3-mini также подчёркивается практическая цель: сделать SLM-модели, которые можно использовать локально и в более ограниченных вычислительных условиях.

Phi-4 интересна тем, что Microsoft не подаёт её как новую архитектурную революцию. Наоборот, и abstract technical report, и официальная публикационная страница Microsoft Research формулируют тезис прямо: заметная прибавка пришла в основном от улучшения данных, curriculum и post-training, а не от радикального пересмотра архитектуры.

Метод

Что делали в Phi-3

Для Phi-3 Microsoft комбинирует два типа источников. Первый — сильно отфильтрованные публичные данные из веба. Второй — синтетические данные, которые в отчёте и model card описываются как близкие по стилю к учебниковым: они должны не просто содержать факт, а структурированно демонстрировать ход решения, объяснение или разбор.

В technical report и на странице Microsoft Research для Phi-3-mini указано 3,3T обучающих токенов, а для Phi-3-small и Phi-3-medium — 4,8T. Для практики важен не только объём, но и состав: модель учат на данных, которые дают более высокую «плотность обучения» на токен. Это и есть наиболее точная расшифровка разговорной формулы «умные данные».

В Azure-анонсе и model card для Phi-3-mini-128k-instruct указаны варианты контекста 4K и 128K. В model card отдельно сказано, что постобучение включает supervised fine-tuning и direct preference optimization; это важная оговорка, потому что прирост серии Phi нельзя сводить только к pretraining.

Что меняется в Phi-4

Phi-4 — это модель на 14B параметров; эта цифра совпадает в technical report и в официальном model card на Hugging Face. В abstract отчёта авторы пишут, что модель «centrally focused on data quality» и, в отличие от многих других LLM, стратегически использует синтетические данные на всём протяжении обучения, а не только как одноразовую добавку.

В model card Phi-4 перечислены четыре крупных блока данных: жёстко отфильтрованные публичные документы и код, синтетические «textbook-like» данные, приобретённые академические книги и наборы вопросов-ответов, а также высококачественные диалоговые данные для supervised tuning. То есть к 2024 году рецепт Phi становится шире: это уже не просто «веб плюс синтетика», а управляемая смесь источников с разной функцией.

Авторы отчёта Phi-4 отдельно утверждают, что предыдущие модели Phi в значительной степени опирались на дистилляцию от GPT-4, а Phi-4 в STEM-ориентированных QA-задачах уже превосходит своего учителя. Это сильное заявление мы оставляем именно как формулировку авторов отчёта: независимой внешней верификации в тех же условиях статья не даёт.

Результаты

Самое полезное сравнение здесь — не «маленькая Phi против огромной фронтирной модели», а Phi-4 14B против Phi-3-medium 14B. Размер сопоставим, поэтому различие лучше изолирует эффект данных и тренировочного рецепта. Таблица ниже собрана по данным Phi-4 Technical Report и официального model card Phi-4.

Бенчмарк Phi-3-medium 14B Phi-4 14B Что проверяет
MMLU 77.9 84.8 Широкие знания и рассуждение
GPQA 31.2 56.1 Сложные научные вопросы уровня graduate
MATH 44.6 80.4 Математическое решение задач
MGSM 53.5 80.6 Школьная математика в нескольких языках
HumanEval 67.8 82.6 Генерация кода
DROP 68.3 75.5 Чтение с дискретным рассуждением
SimpleQA 7.6 3.0 Короткий фактологический QA; здесь Phi-4 хуже

Картина получается неравномерной, и именно поэтому она полезна. На математике, коде и сложном научном QA Phi-4 выглядит существенно сильнее Phi-3 того же порядка размера. Но это не означает общего доминирования «во всём»: на SimpleQA новая модель проигрывает, а в самом technical report авторы отдельно отмечают, что строгому следованию инструкциям они уделяли меньше внимания, чем STEM-рассуждению.

Для Phi-3 собственные показатели тоже важны как историческая точка отсчёта. В technical report и на странице Microsoft Research для Phi-3-mini указаны 69.0 на MMLU и 8.38 на MT-Bench, а для Phi-3-small и Phi-3-medium — 75.0/78.0 на MMLU и 8.7/8.9 на MT-Bench. Эти цифры не доказывают универсальное превосходство над всеми альтернативами, но показывают, что стратегия «лучше данные, а не только больше параметров» дала заметный старт ещё до Phi-4.

Интерпретация

Наш комментарий

Если убрать маркетинговый слой, серия Phi показывает довольно практичную вещь: в компактных dense-моделях качество данных может играть роль не меньшую, чем очередной прирост размера. Сравнение Phi-3-medium 14B и Phi-4 14B особенно показательно именно потому, что размер одинаковый, а результаты на ряде рассуждательных задач расходятся сильно.

Из этого не следует, что архитектура больше не важна. Следует другое: до архитектурного потолка часто есть большой резерв в трёх местах — в отборе корпуса, в curriculum и в post-training. Иными словами, «умные данные» — это не магическая синтетика, а попытка дать модели более обучающий, а не просто более шумный поток токенов.

Для прикладного разработчика здесь есть прямой вывод. Если вы строите небольшую доменную модель, то вопрос «какой base model взять» важен, но не менее важен вопрос «какой обучающий сигнал вы ей дадите». Серия Phi — сильный аргумент в пользу того, что аккуратная смесь фильтрации, синтетических примеров и целевого постобучения может изменить класс возможностей без скачка в размере модели.

Ограничения и критика

Во-первых, почти все ключевые цифры в этом разборе исходят от самой Microsoft: из technical report, model card и официальных страниц. Это нормальные первоисточники, но всё же не независимая репликация. Когда лаборатория и обучает модель, и проектирует evaluation stack, риск оптимизации под собственный набор тестов остаётся.

Во-вторых, серия Phi не показывает, что синтетические данные автоматически лучше сырых данных. Она показывает лишь то, что определённая смесь тщательно отобранных и синтетических данных сработала в конкретном рецепте Microsoft. Переносить этот результат на любую команду, домен или язык без дополнительных экспериментов было бы слишком смело.

В-третьих, даже в собственных результатах Microsoft улучшение не универсально. Phi-4 лучше Phi-3-medium 14B на многих reasoning- и STEM-бенчмарках, но хуже на SimpleQA. Это важная подсказка: модель можно сделать сильнее в рассуждении, не сделав её одновременно лучшей в коротком фактологическом ответе.

В-четвёртых, часть практических деталей мы знаем только из model card. Например, для Phi-4 именно в model card указан состав данных с академическими книгами и QA-наборами; это полезная информация, но не полноценный аудит происхождения и лицензирования каждого компонента. Для компаний, работающих с комплаенсом и юридическими ограничениями, этого уровня прозрачности может быть недостаточно.

Наконец, этот текст намеренно не подменяет исторический срез более поздними релизами. Мы разбираем логику Phi-3 и Phi-4 образца 2024 года, потому что именно в этом срезе лучше всего видна исходная исследовательская гипотеза Microsoft о «качестве токена».

Вывод

Phi-3 и Phi-4 важны не тем, что окончательно доказали «маленькие модели достаточно хороши», а тем, что сделали этот тезис предметом инженерного разбора. В 2024 году Microsoft показала последовательную линию: если улучшать не только масштаб, но и структуру обучающего сигнала, компактные модели могут резко прибавлять в математике, коде и сложном QA.

Главное, что стоит запомнить: в серии Phi прирост объясняется не одной хитрой идеей, а связкой из фильтрации данных, синтетических учебниковых примеров, curriculum и post-training. Это не отменяет ограничений, но делает Phi одним из самых наглядных кейсов про ценность данных в современном LLM-стеке.

Источники

FAQ

Phi-4 — это просто увеличенная Phi-3?

Нет. По данным technical report Phi-4 и официального model card, Phi-4 — это модель на 14B параметров, которую корректнее сравнивать с Phi-3-medium 14B. Авторы подчёркивают, что сильный прирост связан прежде всего с данными, curriculum и post-training, а не с резким архитектурным скачком.

Что здесь значит «умные данные»?

Это не официальный термин Microsoft, а удобное сокращение. В первоисточниках речь идёт о жёстко отфильтрованных публичных данных, синтетических «textbook-like» примерах, а для Phi-4 ещё и о дополнительных высококачественных книгах, QA-наборах и диалоговых данных для постобучения.

Можно ли из серии Phi сделать вывод, что synthetic data всегда лучше?

Нет. Серия Phi показывает, что определённый рецепт синтетики в сочетании с фильтрацией и постобучением может хорошо работать. Но это не универсальный закон: перенос на другой домен, язык или тип задач требует отдельной проверки.

Читайте также