Запись архива

MiMo-V2.5 Pro: обзор модели Xiaomi для длинных агентных задач

MiMo-V2.5 Pro занимает 24-е место в рейтинге COMRAD404 и выделяется сочетанием высокой пользовательской оценки, миллионного контекста и открытых весов. Разбираем, где модель полезна, сколько стоит и что проверить перед внедрением.

MiMo-V2.5 Pro от Xiaomi — профиль модели с миллионным контекстом и открытыми весами

MiMo-V2.5 Pro — модель для тех случаев, когда важнее выдержать длинную цепочку работы, чем получить минимальную задержку первого ответа. В срезе COMRAD404 от 31 августа 2026 года она занимает 24-е место с COMRAD Score 74,7. Профиль неоднородный: редакционная оценка человеческого предпочтения очень высокая — 97,8, доступность получила 100,0, но эффективность заметно слабее — 43,4, а кодовый суббалл составляет 59,5.

Практический вывод такой: MiMo-V2.5 Pro разумно рассматривать как текстовую reasoning-модель для сложных многошаговых задач, агентных сценариев, анализа больших корпусов и программирования с инструментами. Это не универсальный мультимодальный помощник: в паспорте и доступной карточке модели указана текстовая специализация, поэтому обработку изображений, аудио и видео ей приписывать нельзя.

Ниже разделены три типа сведений: показатели паспорта COMRAD404, независимые измерения LMArena и Artificial Analysis, а также официальные заявления Xiaomi о назначении и устройстве модели.

Коротко

  • Место: 24-е в редакции рейтинга COMRAD404 2026 H2.
  • COMRAD Score: 74,7 из 100; это нормализованная редакционная оценка, а не процент правильных ответов.
  • Сильная сторона профиля: human preference 97,8 и access 100,0.
  • Основное ограничение профиля: efficiency 43,4; длинное рассуждение и большой контекст могут увеличивать задержку и расход токенов.
  • Режим работы: reasoning включён, preview — нет.
  • Контекст: 1 050 000 токенов в зафиксированном паспорте.
  • Лицензия: MIT; веса открыты. Это не означает, что программная экосистема, API-провайдеры и инфраструктура поставки автоматически являются открытым ПО.
  • Лучшее применение: кодовые агенты, длительные исследовательские задачи, разбор репозитория, подготовка документов на основе больших входных данных.

Место в рейтинге

В рейтинге COMRAD404 MiMo-V2.5 Pro находится на 24-й позиции с итоговым COMRAD Score 74,7. Итог складывается из пяти нормализованных суббаллов с разными весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Проценты здесь описывают вклад компонентов в редакционную формулу, а сами оценки 0–100 не являются процентами качества модели.

Высокое место по human preference показывает, что модель хорошо выглядит в пользовательских слепых сравнениях. В паспорте для LMArena Text указаны rating 1467,7, 40-е место и 56 020 голосов. Это статистический рейтинг по попарным выборам пользователей, а не доля верных ответов и не универсальный тест фактической точности.

В Code Arena MiMo-V2.5 Pro имеет rating 1475,9 и занимает 43-е место. Такой результат согласуется с умеренным coding-суббаллом 59,5: модель пригодна для программирования, но паспорт не даёт оснований считать её безусловным выбором для любого инженерного процесса.

Artificial Analysis Intelligence Index в паспорте равен 42,9. Это отдельная шкала стороннего измерения, которую нельзя напрямую складывать в голове с LMArena rating или трактовать как процент успешных ответов. В редакционной интерпретации сочетание показателей говорит о модели с сильным восприятием пользователями и широким доступом, но не о безусловном лидерстве по всем типам задач.

Полный контекст рейтинга, методику и положение модели можно проверить на странице рейтинга COMRAD404.

Паспорт модели

Параметр Значение в срезе
Название MiMo-V2.5 Pro
Разработчик Xiaomi
Место в рейтинге 24
COMRAD Score 74,7 из 100
Reasoning Да
Preview Нет
Open weights Да
Лицензия MIT
Контекст 1 050 000 токенов
Цена входа 0,348 доллара за 1 млн токенов
Цена выхода 0,696 доллара за 1 млн токенов

Пять суббаллов: что именно стоит за итогом

Суббалл Оценка Как читать показатель
Quality 67,8 Общий уровень качества по редакционной нормализации; не процент правильных ответов.
Human preference 97,8 Самая сильная часть профиля, связанная с результатами пользовательских сравнений.
Coding 59,5 Умеренная позиция для задач программирования и кодовых агентных сценариев.
Efficiency 43,4 Слабое место: стоимость времени и вычислительного процесса относительно других критериев редакции.
Access 100,0 Максимальная редакционная оценка доступности в данном срезе.

Самая заметная особенность таблицы — разрыв между human preference и efficiency. Пользователи часто выбирают ответы модели в слепых сравнениях, однако это не отменяет задержек, расхода токенов, стоимости длинного контекста и требований к инфраструктуре. Для коротких простых запросов такой профиль может быть избыточным, а для длительных задач — наоборот, оправданным.

Что это за модель

По официальной странице Xiaomi и карточке на Hugging Face, MiMo-V2.5 Pro относится к архитектуре Mixture-of-Experts. Xiaomi указывает 1,02 трлн общих параметров и 42 млрд активных параметров на токен, а также контекст до 1 млн токенов. Веса, токенизатор и модельная карточка опубликованы открыто под лицензией MIT.

Официально модель позиционируется для агентных задач, сложной разработки ПО и длинных траекторий, где система должна сохранять цель, состояние проекта и требования на протяжении множества шагов. Xiaomi также описывает гибридное внимание с чередованием Sliding Window Attention и Global Attention и встроенный Multi-Token Prediction. Эти сведения относятся к заявленной архитектуре и не должны восприниматься как гарантия одинакового выигрыша на каждом провайдере или каждом типе запроса.

В доступных первичных материалах есть инструкции для запуска через Transformers, vLLM и SGLang. При этом карточка прямо предупреждает, что примеры развёртывания являются ориентиром, поскольку движки инференса постоянно обновляются. Для локального запуска понадобится не только скачать веса, но и спроектировать кластер, память, параллелизм и мониторинг.

Возможности и сценарии

Кодовый агент и работа с репозиторием

Reasoning-режим и большой контекст делают модель подходящей для задач, где нужно сначала изучить структуру проекта, затем составить план, внести изменения, запустить тесты и исправить последствия. На практике ценность здесь определяется не одной генерацией функции, а способностью выдерживать цикл «прочитать — изменить — проверить — откатить или уточнить».

Модель можно использовать для рефакторинга, поиска причин регрессий, миграции API, подготовки тестов и ревью нескольких связанных модулей. Однако coding-суббалл 59,5 советует не передавать ей без проверки критические изменения. Агенту нужны песочница, ограниченные права, автоматические тесты и понятный журнал действий.

Длинные документы и исследовательские задачи

Контекст 1 050 000 токенов полезен, если вход действительно велик: коллекция технических документов, история изменений проекта, набор нормативных текстов или массив переписки. Это не означает, что модель одинаково хорошо извлечёт любой факт из миллиона токенов. Чем длиннее вход, тем важнее структура, оглавление, якоря, промежуточные резюме и проверка цитат.

Планирование и инструментальные цепочки

MiMo-V2.5 Pro подходит для декомпозиции задачи на этапы, подготовки команд и обработки результатов внешних инструментов. Лучше всего задавать ей явные критерии завершения: какие файлы изменить, какие тесты пройти, какие ограничения соблюдать и что считать ошибкой. Без этого длинный контекст может превратиться не в память проекта, а в накопление лишних сообщений.

Текстовая аналитика

Для классификации, извлечения полей, сопоставления документов и подготовки черновиков модель может быть полезна, особенно если требуется рассуждение по нескольким источникам. Но для массовой простой обработки более сложная reasoning-модель не всегда рациональна: низкая efficiency-оценка подсказывает заранее измерить фактический расход токенов и время выполнения.

Цена и скорость

В паспорте указана цена 0,348 доллара за 1 млн входных токенов и 0,696 доллара за 1 млн выходных токенов. Это значения конкретного зафиксированного среза, а не обещание неизменного тарифа. Цена может отличаться в зависимости от API-провайдера, региона, режима, кэширования, правил округления и условий конкретного плана.

Зафиксированная скорость генерации составляет 37,3 токена в секунду, а time to first token — 3,23 секунды. Это разные единицы измерения: первая описывает темп выдачи после старта, вторая — ожидание до первого токена. Нельзя превращать их в единый «процент быстродействия». На практике обе величины зависят от длины запроса, нагрузки, reasoning-настроек, очереди, провайдера и сетевого маршрута.

Для оценки бюджета полезно считать не только размер промпта, но и число итераций агента. Один длинный запрос может оказаться дешёвым по тарифу, но дорогим по суммарной траектории, если модель многократно перечитывает контекст и вызывает инструменты. Для долгих сессий отдельно измеряйте кэшированные токены, выходной расход и стоимость неудачных попыток.

Открытые веса и самостоятельное развёртывание

MiMo-V2.5 Pro имеет открытые веса и лицензию MIT согласно паспорту и странице модели на Hugging Face. Это даёт возможность изучать чекпойнт, запускать его в совместимой инфраструктуре и выбирать собственный контур обработки данных. Но открытые веса не равны «установил на ноутбук и запустил»: речь идёт о модели масштаба, для которой требования к GPU-памяти, межузловой связи и настройке движка существенно влияют на результат.

Официальная карточка предлагает варианты для Transformers, vLLM и SGLang, а также указывает на необходимость trust_remote_code в некоторых примерах. Перед использованием такого режима стоит провести аудит кода загрузки, зафиксировать версии зависимостей и запускать модель в изолированной среде. Для корпоративного развёртывания отдельно проверьте совместимость лицензии с вашим продуктом и правила хранения пользовательских данных.

Ограничения

  • Текстовая специализация. Не следует рассчитывать на нативный анализ изображений, видео или аудио. Для таких входов потребуется другая модель или отдельный препроцессор.
  • Высокий порог инфраструктуры. 1,02 трлн общих параметров и FP8-веса не делают локальный запуск малоресурсным. Практическая конфигурация зависит от движка и режима параллелизма.
  • Задержка. TTFT 3,23 секунды и скорость 37,3 токена в секунду зафиксированы в паспорте, но не являются гарантией для всех API.
  • Эффективность ниже других частей профиля. Значение 43,4 требует считать стоимость полной задачи, а не только цену миллиона токенов.
  • Нельзя переносить рекламные демонстрации на ваш процесс. Официальные примеры Xiaomi показывают возможности в выбранных ими сценариях, но не заменяют независимый пилот на вашем наборе данных.
  • Большой контекст не отменяет верификацию. Модель может потерять связь между удалёнными фрагментами, неправильно интерпретировать конфликтующие источники или уверенно сформулировать ошибочный вывод.
  • Агентные действия требуют контроля. Инструменты, файловая система, сеть и команды должны быть ограничены политиками доступа и проверками результата.

Как проверить на своей задаче

  1. Соберите репрезентативный набор. Возьмите реальные запросы, включая обычные, сложные и пограничные случаи. Не ограничивайтесь красивыми демонстрациями.
  2. Разделите режимы. Отдельно проверьте обычный текстовый ответ, reasoning-сценарий и работу с инструментами. Фиксируйте температуру, лимит вывода, системный промпт и версию API.
  3. Задайте измеримые критерии. Для кода это тесты, сборка, отсутствие регрессий и корректность diff. Для документов — полнота извлечения, точность ссылок и процент исправлений редактора.
  4. Проверьте длинный контекст ступенчато. Запустите одинаковую задачу на 32K, 128K, 512K и близком к лимиту объёме. Сравните не только ответ, но и способность найти факты в начале, середине и конце.
  5. Посчитайте полную стоимость. Учитывайте вход, выход, повторные вызовы, кэширование, tool calls и время инженера на проверку.
  6. Проверьте отказоустойчивость. Намеренно добавьте противоречивые требования, неполные файлы, падающие тесты и недоступный инструмент. Хороший агент должен корректно остановиться или запросить уточнение.
  7. Сравните API и локальный контур отдельно. Не переносите скорость облачного провайдера на собственный кластер и наоборот. Результаты зависят от движка, железа и ограничений сервиса.

Минимальный практический пилот — 50–100 задач, три независимых прогона на каждый сценарий, сохранение всех промптов и ответов, а также ручная проверка случайной выборки. Для кодового агента добавьте контрольную ветку репозитория и автоматический rollback.

Кому подойдёт MiMo-V2.5 Pro

Модель подходит командам, которым нужны открытые веса, текстовый reasoning, длинная память задачи и возможность подключать инструменты. Наиболее логичные кандидаты — разработчики внутренних кодовых агентов, исследовательские группы, команды технической документации и проекты, где важна независимость от одного интерфейса.

Она менее очевидна для коротких чат-запросов, простого массового извлечения и мультимодальных продуктов. В этих случаях размер контекста и агентная направленность могут не окупаться, а слабый efficiency-суббалл становится практически значимее высокой оценки человеческого предпочтения.

Редакционный вердикт

MiMo-V2.5 Pro — сильный специализированный выбор для длинных текстовых процессов, а не модель «на все случаи». Её 24-е место в рейтинге COMRAD404 объясняется не одним рекордным числом, а балансом: высокий human preference и максимальная access-оценка поддерживают итог, тогда как quality 67,8, coding 59,5 и особенно efficiency 43,4 ограничивают универсальность.

Если ваша задача состоит из множества связанных шагов, требует работы с репозиторием или большим корпусом и допускает проверку результатов, модель стоит включить в пилот. Если приоритетом являются минимальная задержка, мультимодальность или дешёвая обработка коротких запросов, решение нужно принимать только после отдельного измерения — паспорт этого не гарантирует.

FAQ

Какое место занимает MiMo-V2.5 Pro?

В редакции рейтинга COMRAD404 2026 H2 модель занимает 24-е место с COMRAD Score 74,7 из 100.

Является ли LMArena rating процентом качества?

Нет. Значения 1467,7 в Text Arena и 1475,9 в Code Arena — статистические рейтинги по слепым попарным сравнениям. Они не означают 1467,7% или долю правильных ответов.

Поддерживает ли MiMo-V2.5 Pro изображения и аудио?

В доступном паспорте и первичной карточке модели она описана как текстовая. Поэтому нативную обработку изображений, аудио и видео ей приписывать нельзя.

Сколько стоит миллион токенов?

В срезе указано 0,348 доллара за 1 млн входных токенов и 0,696 доллара за 1 млн выходных. Это значения среза; фактический тариф зависит от провайдера, режима и условий API.

Можно ли запустить модель самостоятельно?

Да, веса открыты, лицензия в паспорте — MIT, а официальная карточка содержит примеры для Transformers, vLLM и SGLang. Но самостоятельное развёртывание требует подходящей GPU-инфраструктуры, настройки движка и проверки безопасности удалённого кода.

Что проверить перед внедрением?

Проверьте качество на собственных задачах, стабильность длинного контекста, стоимость полной агентной траектории, задержку, корректность tool calls, обработку ошибок и требования к локальной инфраструктуре.

Источники