Запись архива

MiniMax M2.7: обзор модели, рейтинг, цена и сценарии

MiniMax M2.7 — модель с открытыми весами и ограниченной коммерческой лицензией, сильным пользовательским предпочтением и большим контекстом. Разбираем рейтинг, цену, сценарии и ограничения.

MiniMax M2.7 — модель с открытыми весами для агентной разработки и работы с длинным контекстом

MiniMax M2.7 — модель для тех, кому важнее рабочий агентный процесс, инструменты и длинный контекст, чем максимально высокий универсальный балл. В редакционном рейтинге COMRAD404 зафиксированная версия занимает 61-е место с COMRAD Score 63,3 из 100. Профиль неоднородный: суббалл human preference заметно выше качества и программирования, а эффективность входит в сильные стороны. Это делает M2.7 интересным кандидатом для прототипов агентов, разработки и задач с большим объёмом контекста, но не универсальным выбором без собственного тестирования.

Коротко

  • Модель: MiniMax M2.7.
  • Разработчик: MiniMax.
  • Позиция COMRAD404: 61-е место в выпуске 2026 H2.
  • COMRAD Score: 63,3 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
  • Сильнейший суббалл: human preference — 83,7 из 100.
  • Самый слабый суббалл: coding — 45,9 из 100; quality также умеренный — 50,0.
  • Контекст: 204 800 токенов в паспорте рейтинга.
  • Цена в зафиксированном срезе: 0,30 доллара за миллион входных токенов и 1,20 доллара за миллион выходных.
  • Скорость: данных о времени до первого токена и скорости генерации в паспорте нет.
  • Режим: не preview; reasoning в паспорте не отмечен.

Итоговый ориентир простой: M2.7 стоит рассматривать там, где ценятся длинные документы, вызов инструментов, итеративная работа и доступ к весам. Для критичного production-кода, строгого следования спецификации или задач, где важна предсказуемая скорость, сначала нужен пилот на собственных данных.

Что это за модель

MiniMax M2.7 — языковая модель MiniMax, представленная разработчиком 18 марта 2026 года. В официальных материалах компания связывает её с агентными сценариями, программированием, офисными задачами и многошаговой работой через инструменты. Разработчик отдельно описывает Agent Teams, сложные skills, динамический поиск инструментов и эксперименты с самоулучшением собственного агентного окружения.

Это важно правильно интерпретировать. Утверждения MiniMax о внутреннем процессе разработки, демонстрациях и результатах собственных тестов являются заявлениями разработчика. Они показывают направление оптимизации модели, но не заменяют независимый аудит на вашем наборе задач. В профиле COMRAD404 эти заявления не превращаются автоматически в баллы: итоговая оценка строится на переданных редакционных суббаллах и зафиксированных внешних метриках.

Весовые файлы модели доступны, однако формулировка «open weights» не означает, что модель распространяется как программное обеспечение с полностью свободной лицензией. В репозитории MiniMax указаны ограничения: для коммерческого использования требуется предварительное разрешение, а производные коммерческие продукты должны выполнять условия лицензии и атрибуции. Поэтому M2.7 корректнее называть моделью с открытыми весами и Modified MIT-лицензией с ограничениями, а не безусловно свободным open-source решением.

Паспорт модели

Параметр Значение в срезе
Название MiniMax M2.7
Разработчик MiniMax
Дата среза 31 августа 2026 года
Выпуск рейтинга 2026 H2
Место COMRAD404 61
Лицензия Modified MIT
Открытые веса Да, с лицензионными ограничениями
Reasoning Нет в паспорте
Preview Нет
Контекст 204 800 токенов
Вход 0,30 доллара за 1 млн токенов
Выход 1,20 доллара за 1 млн токенов
Output tokens per second Данных нет
Time to first token Данных нет

Место в рейтинге

В выпуске COMRAD404 2026 H2 MiniMax M2.7 находится на 61-й позиции с итоговым COMRAD Score 63,3. Рейтинг отражает совокупность пяти нормализованных редакционных оценок: quality, human preference, coding, efficiency и access. Это не единая лабораторная метрика и не вероятность успешного ответа.

В независимых данных LMArena модель имеет текстовый рейтинг 1416,5, 121-е место и 63 907 голосов. В Code Arena указаны рейтинг 1398,8 и 69-е место. LMArena использует статистику слепых попарных сравнений: число 1416,5 нельзя читать как «1416,5 процента» или как долю правильных ответов. Большое число голосов делает текстовую оценку информативнее одиночного пользовательского отзыва, но не отменяет зависимости результата от состава запросов и конкурирующих моделей.

Показатель Artificial Analysis Intelligence Index в данном срезе отсутствует. Поэтому нельзя честно заполнить этот пробел оценкой по памяти или заменить его результатами MiniMax на внутренних бенчмарках. Отсутствие метрики — часть паспорта, которую следует учитывать при сравнении поставщиков.

Подробное место модели и методику можно посмотреть в общем рейтинге COMRAD404.

Как читать пять суббаллов

Суббалл Оценка Редакционная интерпретация
Quality 50,0 из 100 Средний профиль базового качества; не даёт оснований считать модель безусловно сильной во всех типах задач.
Human preference 83,7 из 100 Сильная сторона: ответы чаще воспринимаются пользователями как предпочтительные в соответствующем сравнительном контексте.
Coding 45,9 из 100 Умеренный результат по редакционной шкале; для сложной разработки необходимы тесты, ревью и контроль инструментов.
Efficiency 79,8 из 100 Хорошее соотношение практической полезности и заявленной стоимости в профиле рейтинга.
Access 66,6 из 100 Доступность выше среднего, но итог зависит от провайдера, региона, лимитов и условий развёртывания.

Главная особенность профиля — разрыв между human preference и coding. Это не противоречие: модель может хорошо поддерживать естественный диалог, удерживать рабочий контекст и быть удобной в агентном цикле, но при этом чаще ошибаться в точном коде, архитектурных деталях или длинной цепочке изменений. Высокий efficiency также не следует путать со скоростью генерации: в паспорте нет ни output tokens per second, ни time to first token.

Возможности и сценарии

Официальная страница M2.7 позиционирует модель вокруг программирования, агентных инструментов и профессиональной работы с документами. Разработчик приводит примеры создания веб-проектов, анализа журналов, поиска причин ошибок, рефакторинга, проверки безопасности и задач машинного обучения. В собственных измерениях MiniMax сообщает о 56,22% на SWE-Pro, 55,6% на VIBE-Pro и 57,0% на Terminal Bench 2. Эти значения относятся к тестам разработчика и не являются числами паспорта COMRAD404.

Практически модель имеет смысл проверять в четырёх группах задач:

  • Агентная разработка: разбиение задачи на этапы, чтение репозитория, вызов тестов, исправление ошибок и подготовка изменений к ревью.
  • Поддержка production-систем: сопоставление логов, конфигураций, трассировок и истории деплоев. Здесь модель полезна как помощник по гипотезам, но не как автономный оператор без ограничений доступа.
  • Длинные документы: анализ нескольких спецификаций, отчётов, журналов или проектной документации в одном рабочем контексте.
  • Офисные и исследовательские процессы: подготовка черновиков Word, Excel и PowerPoint, последовательное редактирование и преобразование результатов в структурированные deliverables.

Для обычного чата полезность будет зависеть от качества промпта и предметной области. Сильная сторона M2.7 раскрывается не в одном эффектном ответе, а в цикле «получить контекст — вызвать инструмент — проверить результат — исправить». Именно поэтому при оценке следует тестировать не только финальный текст, но и поведение модели на промежуточных шагах.

Цена и скорость

В паспорте зафиксирована цена 0,30 доллара за миллион входных токенов и 1,20 доллара за миллион выходных токенов. При одинаковом объёме текста выход обычно обходится дороже входа, поэтому агентные сценарии с длинными ответами, большим числом итераций и повторными вызовами инструментов нужно считать по реальному токенному профилю, а не по цене одного запроса.

Цена относится к конкретному срезу и не должна восприниматься как постоянное обещание. API-провайдеры могут менять тарифы, вводить разные режимы, кэширование, лимиты и отдельные варианты high-speed-доступа. На официальной странице MiniMax упомянуты стандартный M2.7 и режим M2.7-highspeed, но в паспорте COMRAD404 нет числовой скорости для выбранного режима.

Поля output tokens per second и time to first token помечены как отсутствующие. Это означает, что по данному профилю нельзя делать вывод о latency, пропускной способности или пригодности модели для интерактивного интерфейса. Перед закупкой проверьте p50 и p95 времени до первого токена, скорость на коротких и длинных ответах, поведение при параллельных запросах и лимиты конкретного API.

Ограничения

  • Неоднородные метрики. Высокий human preference не компенсирует автоматически умеренные quality и coding. Модель может нравиться пользователям и всё же требовать строгой верификации результата.
  • Нет Intelligence Index. В срезе отсутствует Artificial Analysis Intelligence Index, поэтому одна из внешних точек сопоставления недоступна.
  • Нет данных о скорости. Нельзя использовать эту карточку для обещаний по задержке или TPS.
  • Лицензия требует проверки. Открытые веса не означают отсутствие коммерческих ограничений. Перед встраиванием в продукт нужно изучить текст лицензии, условия атрибуции и требования к производным решениям.
  • Агентные сценарии повышают стоимость и риск. Многошаговый цикл с инструментами увеличивает расход токенов и может привести к ошибочным действиям, если права доступа не ограничены.
  • Бенчмарки не равны production. Заявленные MiniMax результаты на SWE-Pro, VIBE-Pro, Terminal Bench 2 и офисных тестах показывают выбранные срезы, но не гарантируют тот же результат на закрытом коде, внутренних стандартах и ваших форматах документов.

Отдельно стоит учитывать, что reasoning в паспорте не отмечен. Не следует самостоятельно приписывать модели специальный режим рассуждений или делать вывод о внутреннем процессе генерации только по тому, что она решает многошаговые задачи.

Для кого подходит MiniMax M2.7

M2.7 подходит командам, которые хотят экспериментировать с моделью через API или с открытыми весами, готовы строить вокруг неё собственный harness и умеют проверять результаты автоматическими тестами. Она особенно уместна в прототипах coding-агентов, внутренних исследовательских инструментах, разборе документации и задачах, где важен контекст до 204 800 токенов.

Модель менее очевидна для сценариев, где главным критерием является подтверждённая задержка, стабильная работа в жёстком формате JSON, юридически чувствительные решения или полностью свободное коммерческое распространение. В этих случаях нужны отдельная проверка провайдера, лицензии и контрольные тесты на отказоустойчивость.

Как проверить на своей задаче

  1. Соберите репрезентативный набор. Возьмите 30–100 реальных запросов: типовые, сложные, пограничные и заведомо ошибочные.
  2. Разделите этапы. Отдельно измеряйте понимание инструкции, качество плана, вызов инструментов, финальный ответ и восстановление после ошибки.
  3. Для кода используйте исполнимую проверку. Запускайте unit-тесты, линтеры, type checker, security scanner и тесты на регрессии. Красивый diff не является доказательством корректности.
  4. Для документов проверяйте структуру. Сравнивайте не только текст, но и формулы, ссылки, стили, таблицы, редактируемость файлов и сохранение исходного шаблона.
  5. Измерьте экономику. Запишите входные и выходные токены, количество повторных вызовов, долю неудачных попыток и стоимость одного принятого результата.
  6. Измерьте задержку у провайдера. Зафиксируйте время до первого токена и полное время ответа при разных размерах контекста и уровнях параллелизма.
  7. Проверьте лицензионный путь. Если используются открытые веса, заранее определите, допускает ли лицензия ваш коммерческий сценарий, модификации, распространение и облачное обслуживание.

Для честного сравнения используйте одинаковые системные инструкции, инструменты, лимиты и бюджеты. Оценивайте не лучший демонстрационный ответ, а медиану, долю успешных запусков и цену исправления ошибки.

Источники

Паспортные числа рейтинга взяты из переданного редакционного среза COMRAD404 на 31 августа 2026 года. Официальные сведения о возможностях, доступе и заявленных разработчиком тестах проверены по материалам MiniMax. Лицензионные ограничения — по репозиторию и файлу лицензии модели.

FAQ

Какое место занимает MiniMax M2.7?

В редакционном рейтинге COMRAD404 2026 H2 модель занимает 61-е место с COMRAD Score 63,3 из 100.

Можно ли считать 1416,5 в LMArena процентом качества?

Нет. 1416,5 — статистический рейтинг по слепым попарным сравнениям в текстовой арене. Это не процент правильных ответов.

Какая цена MiniMax M2.7?

В паспорте среза указаны 0,30 доллара за миллион входных токенов и 1,20 доллара за миллион выходных токенов. Тарифы зависят от API-провайдера и режима и могут меняться.

Известна ли скорость генерации?

Нет. В переданном паспорте отсутствуют значения output tokens per second и time to first token. Их нужно измерять у конкретного провайдера.

Является ли M2.7 полностью открытым программным обеспечением?

Нет. У модели открыты веса, но Modified MIT-лицензия содержит ограничения, включая отдельные условия для коммерческого использования. Юридическую применимость нужно проверить до внедрения.

Для каких задач модель стоит тестировать в первую очередь?

Начните с coding-агента, длинной технической документации, вызова инструментов и многошагового редактирования документов. Обязательно добавьте автоматические тесты и измерение стоимости полного рабочего цикла.