
Авторы препринта OMP-MoE представили метод сокращения числа экспертов в больших языковых моделях с архитектурой Mixture-of-Experts. Он не требует дополнительного обучения и превращает поиск полезного подмножества экспертов в задачу разреженного восстановления сигнала.
В аннотации работы сообщается об экспериментах на моделях семейств Qwen, DeepSeek-V2, GPT-OSS и Mixtral с долей удаляемых экспертов от 25% до 50%. Наиболее конкретный опубликованный результат относится к Qwen3-30B-A3B: при 50-процентном сокращении авторы сохранили 93,3% исходной производительности модели, ускорили процедуру поиска в 33 раза и получили ускорение инференса в 1,55 раза.
Это пока результаты самих исследователей. Работа опубликована как препринт, а исходный код обещан только после принятия статьи, поэтому независимо проверить заявленные показатели сейчас затруднительно.
Вместо перебора — восстановление сигнала
MoE-модель содержит несколько специализированных блоков-экспертов, но для обработки конкретного токена маршрутизатор обычно выбирает только небольшую их часть. Такой подход позволяет увеличивать общее число параметров, не задействуя их одновременно при каждом вычислении.
Проблема возникает при развёртывании: даже редко используемые эксперты необходимо хранить в памяти или подгружать во время работы. Удаление части экспертов может сократить требования к инфраструктуре, но простой выбор по частоте использования не всегда учитывает, насколько один эксперт способен компенсировать другой.
OMP-MoE рассматривает выходы отдельных экспертов как элементы словаря, из которых нужно восстановить исходный совокупный сигнал. Для отбора используется Orthogonal Matching Pursuit — жадный алгоритм, последовательно добавляющий элементы, сильнее всего уменьшающие ошибку восстановления.
По утверждению авторов, такой подход учитывает взаимосвязи между экспертами и имеет линейную вычислительную сложность. Это должно сделать поиск подходящей конфигурации практичнее, чем методы с дорогостоящим перебором вариантов. Однако из доступной аннотации нельзя установить, с какими именно алгоритмами сравнивалась скорость поиска и на каком оборудовании получено ускорение в 33 раза.
Как эксперты распределяются между слоями
Одинаковое сокращение каждого слоя может быть неоптимальным: в одних слоях выходы экспертов сильнее дублируют друг друга, а в других удаление даже небольшого числа блоков заметно влияет на маршрутизацию и качество.
Для решения этой проблемы OMP-MoE использует межслойную схему распределения по принципу water-filling. Она определяет, сколько экспертов оставить в разных частях модели, учитывая два критерия:
- ошибку реконструкции после удаления экспертов;
- стабильность маршрутизации токенов между оставшимися блоками.
Таким образом, заявленные 25% или 50% pruning относятся к общему бюджету сокращения, а не обязательно к одинаковой доле в каждом слое. Метод может сохранить больше экспертов там, где модель чувствительнее к их удалению, и сильнее сократить слои с выраженной избыточностью.
Авторы также описывают вариант OMP-MoE† для адаптивного инференса. Он динамически регулирует число активируемых экспертов на основании прогнозируемой «энергии» сигнала. Это не следует путать с измерением энергопотребления ускорителей: в аннотации нет данных о расходе электричества, мощности GPU или стоимости эксплуатации.
Что показали тесты на Qwen, DeepSeek и Mixtral
Главный численный пример в препринте — Qwen3-30B-A3B. По данным авторов, при 50-процентном сокращении экспертов модель сохраняет 93,3% исходного результата, а инференс ускоряется в 1,55 раза. Как именно рассчитан агрегированный показатель производительности и какие задачи вошли в оценку, необходимо проверять по полной версии исследования.
Эксперименты также охватывают DeepSeek-V2, GPT-OSS и Mixtral. Это архитектуры с разным устройством MoE-слоёв и маршрутизации, поэтому единообразное улучшение на нескольких семействах было бы более значимым результатом, чем тест на одной модели. Техническое описание DeepSeek-V2, например, включает собственную схему распределения экспертов, а Mixtral 8x7B использует разреженную активацию экспертов в каждом слое.
Вместе с тем абстракт OMP-MoE не приводит отдельные показатели качества и скорости для каждой архитектуры. Формулировка о «стабильных улучшениях» при pruning на 25–50% остаётся заявлением авторов до публикации подробных таблиц, настроек и воспроизводимого кода.
Результат также нельзя трактовать как двукратное уменьшение всей модели. Даже если удалено 50% экспертов, в памяти остаются общие компоненты: механизмы внимания, маршрутизаторы, эмбеддинги, нормализация и другие параметры. Реальное сокращение размера зависит от того, какую долю весов конкретной архитектуры занимают экспертные блоки. Карточка Qwen3-30B-A3B указывает на различие между общим и активным числом параметров, но для оценки эффекта pruning нужны замеры фактического объёма весов и пиковой памяти.
Что проверять перед внедрением
Для разработчиков OMP-MoE интересен прежде всего как потенциально более дешёвый способ подготовить крупную MoE-модель к локальному или серверному инференсу. Отсутствие дообучения может снизить порог эксперимента, поскольку не требуется полный тренировочный цикл. Это, однако, не означает, что сжатие выполняется без данных: для анализа вкладов экспертов и маршрутизации, вероятно, понадобится репрезентативная калибровочная выборка. Её состав и объём должны быть описаны в полной статье.
После появления кода практическая проверка должна включать не только среднюю оценку на бенчмарках. Имеет смысл отдельно измерить:
- пиковое потребление памяти до и после удаления экспертов;
- скорость в токенах в секунду при одинаковых batch size, длине контекста и оборудовании;
- задержку первого токена и последующей генерации;
- качество на целевых языках и типах запросов;
- изменение распределения нагрузки между оставшимися экспертами;
- устойчивость результата при другой калибровочной выборке.
Особенно важно не переносить ускорение в 1,55 раза на любую MoE-модель и любую инфраструктуру. Итог зависит от реализации ядра, способа хранения весов, пропускной способности памяти, размера пакета и того, удаётся ли системе физически не загружать удалённые блоки.
До публикации репозитория OMP-MoE следует рассматривать как исследовательский результат, а не готовый инструмент с подтверждённой экономией ресурсов. Ключевые вопросы для проверки — воспроизводимость 93,3% исходного качества, условия сравнения скорости поиска и фактическое уменьшение памяти на разных MoE-архитектурах.








