OMP-MoE сокращает число экспертов в MoE-моделях без дообучения

Авторы OMP-MoE предложили удалять избыточных экспертов из MoE-моделей с помощью Orthogonal Matching Pursuit. На Qwen3-30B-A3B метод, по их данным, сохранил 93,3% исходного качества при 50-процентном сокращении экспертов и ускорил инференс в 1,55 раза.

Схема отбора экспертов в Mixture-of-Experts модели методом Orthogonal Matching Pursuit
Схема отбора экспертов в Mixture-of-Experts модели методом Orthogonal Matching Pursuit
Arlington State College Library, students studying (10010394).jpg | by University of Texas at Arlington Photograph Collection | wikimedia_commons | CC BY 4.0

Авторы препринта OMP-MoE представили метод сокращения числа экспертов в больших языковых моделях с архитектурой Mixture-of-Experts. Он не требует дополнительного обучения и превращает поиск полезного подмножества экспертов в задачу разреженного восстановления сигнала.

В аннотации работы сообщается об экспериментах на моделях семейств Qwen, DeepSeek-V2, GPT-OSS и Mixtral с долей удаляемых экспертов от 25% до 50%. Наиболее конкретный опубликованный результат относится к Qwen3-30B-A3B: при 50-процентном сокращении авторы сохранили 93,3% исходной производительности модели, ускорили процедуру поиска в 33 раза и получили ускорение инференса в 1,55 раза.

Это пока результаты самих исследователей. Работа опубликована как препринт, а исходный код обещан только после принятия статьи, поэтому независимо проверить заявленные показатели сейчас затруднительно.

Вместо перебора — восстановление сигнала

MoE-модель содержит несколько специализированных блоков-экспертов, но для обработки конкретного токена маршрутизатор обычно выбирает только небольшую их часть. Такой подход позволяет увеличивать общее число параметров, не задействуя их одновременно при каждом вычислении.

Проблема возникает при развёртывании: даже редко используемые эксперты необходимо хранить в памяти или подгружать во время работы. Удаление части экспертов может сократить требования к инфраструктуре, но простой выбор по частоте использования не всегда учитывает, насколько один эксперт способен компенсировать другой.

OMP-MoE рассматривает выходы отдельных экспертов как элементы словаря, из которых нужно восстановить исходный совокупный сигнал. Для отбора используется Orthogonal Matching Pursuit — жадный алгоритм, последовательно добавляющий элементы, сильнее всего уменьшающие ошибку восстановления.

По утверждению авторов, такой подход учитывает взаимосвязи между экспертами и имеет линейную вычислительную сложность. Это должно сделать поиск подходящей конфигурации практичнее, чем методы с дорогостоящим перебором вариантов. Однако из доступной аннотации нельзя установить, с какими именно алгоритмами сравнивалась скорость поиска и на каком оборудовании получено ускорение в 33 раза.

Как эксперты распределяются между слоями

Одинаковое сокращение каждого слоя может быть неоптимальным: в одних слоях выходы экспертов сильнее дублируют друг друга, а в других удаление даже небольшого числа блоков заметно влияет на маршрутизацию и качество.

Для решения этой проблемы OMP-MoE использует межслойную схему распределения по принципу water-filling. Она определяет, сколько экспертов оставить в разных частях модели, учитывая два критерия:

  • ошибку реконструкции после удаления экспертов;
  • стабильность маршрутизации токенов между оставшимися блоками.

Таким образом, заявленные 25% или 50% pruning относятся к общему бюджету сокращения, а не обязательно к одинаковой доле в каждом слое. Метод может сохранить больше экспертов там, где модель чувствительнее к их удалению, и сильнее сократить слои с выраженной избыточностью.

Авторы также описывают вариант OMP-MoE† для адаптивного инференса. Он динамически регулирует число активируемых экспертов на основании прогнозируемой «энергии» сигнала. Это не следует путать с измерением энергопотребления ускорителей: в аннотации нет данных о расходе электричества, мощности GPU или стоимости эксплуатации.

Что показали тесты на Qwen, DeepSeek и Mixtral

Главный численный пример в препринте — Qwen3-30B-A3B. По данным авторов, при 50-процентном сокращении экспертов модель сохраняет 93,3% исходного результата, а инференс ускоряется в 1,55 раза. Как именно рассчитан агрегированный показатель производительности и какие задачи вошли в оценку, необходимо проверять по полной версии исследования.

Эксперименты также охватывают DeepSeek-V2, GPT-OSS и Mixtral. Это архитектуры с разным устройством MoE-слоёв и маршрутизации, поэтому единообразное улучшение на нескольких семействах было бы более значимым результатом, чем тест на одной модели. Техническое описание DeepSeek-V2, например, включает собственную схему распределения экспертов, а Mixtral 8x7B использует разреженную активацию экспертов в каждом слое.

Вместе с тем абстракт OMP-MoE не приводит отдельные показатели качества и скорости для каждой архитектуры. Формулировка о «стабильных улучшениях» при pruning на 25–50% остаётся заявлением авторов до публикации подробных таблиц, настроек и воспроизводимого кода.

Результат также нельзя трактовать как двукратное уменьшение всей модели. Даже если удалено 50% экспертов, в памяти остаются общие компоненты: механизмы внимания, маршрутизаторы, эмбеддинги, нормализация и другие параметры. Реальное сокращение размера зависит от того, какую долю весов конкретной архитектуры занимают экспертные блоки. Карточка Qwen3-30B-A3B указывает на различие между общим и активным числом параметров, но для оценки эффекта pruning нужны замеры фактического объёма весов и пиковой памяти.

Что проверять перед внедрением

Для разработчиков OMP-MoE интересен прежде всего как потенциально более дешёвый способ подготовить крупную MoE-модель к локальному или серверному инференсу. Отсутствие дообучения может снизить порог эксперимента, поскольку не требуется полный тренировочный цикл. Это, однако, не означает, что сжатие выполняется без данных: для анализа вкладов экспертов и маршрутизации, вероятно, понадобится репрезентативная калибровочная выборка. Её состав и объём должны быть описаны в полной статье.

После появления кода практическая проверка должна включать не только среднюю оценку на бенчмарках. Имеет смысл отдельно измерить:

  • пиковое потребление памяти до и после удаления экспертов;
  • скорость в токенах в секунду при одинаковых batch size, длине контекста и оборудовании;
  • задержку первого токена и последующей генерации;
  • качество на целевых языках и типах запросов;
  • изменение распределения нагрузки между оставшимися экспертами;
  • устойчивость результата при другой калибровочной выборке.

Особенно важно не переносить ускорение в 1,55 раза на любую MoE-модель и любую инфраструктуру. Итог зависит от реализации ядра, способа хранения весов, пропускной способности памяти, размера пакета и того, удаётся ли системе физически не загружать удалённые блоки.

До публикации репозитория OMP-MoE следует рассматривать как исследовательский результат, а не готовый инструмент с подтверждённой экономией ресурсов. Ключевые вопросы для проверки — воспроизводимость 93,3% исходного качества, условия сравнения скорости поиска и фактическое уменьшение памяти на разных MoE-архитектурах.

Источники