MiMo-V2.5 стоит рассматривать прежде всего как доступную мультимодальную основу для агентов, обработки больших массивов данных и собственного развёртывания, а не как безусловно лучшую модель для сложного рассуждения или программирования. В рейтинге COMRAD404 она занимает 29-е место с итоговой оценкой 69,8. Профиль необычный: модель высоко оценивают участники слепых сравнений, а открытые веса под лицензией MIT дают ей максимальный суббалл за доступ. При этом независимый индекс интеллекта, кодовый результат и измеренная эффективность остаются умеренными.
Коротко
- Выбирать MiMo-V2.5 стоит, если нужны открытые веса, обработка текста, изображений, видео и аудио, контекст около миллиона токенов или недорогой API.
- Главная сильная сторона профиля — human preference: 88,5 из 100 при 44 515 голосах в текстовой LMArena.
- Главный компромисс — разрыв между пользовательским предпочтением и более сдержанными оценками качества и кодинга.
- Для локального запуска модель доступна, но это крупная MoE-система: открытые веса не означают простой запуск на обычном рабочем компьютере.
- Статус в паспорте — не preview. Это, однако, не заменяет проверку стабильности, безопасности и поддержки перед промышленным внедрением.
Паспорт модели
| Параметр | Значение на 31 августа 2026 года |
|---|---|
| Разработчик | Xiaomi |
| Место в рейтинге | 29 |
| COMRAD Score | 69,8 из 100 |
| Artificial Analysis Intelligence Index | 38,0 |
| LMArena Text | 1433,9; место 92; 44 515 голосов |
| LMArena Code | 1437,5; место 56 |
| Цена ввода | $0,112 за 1 млн токенов |
| Цена вывода | $0,224 за 1 млн токенов |
| Скорость вывода | 60,3 токена/с |
| Время до первого токена | 1,93 с |
| Контекст | 1 050 000 токенов в измерении паспорта |
| Рассуждение | Поддерживается |
| Веса и лицензия | Открытые веса, MIT |
| Достоверность паспорта | Высокая |
COMRAD Score и суббаллы — нормализованные редакционные оценки по шкале 0–100, а не проценты правильных ответов. Intelligence Index, рейтинги LMArena, доллары за токены, токены в секунду и размер контекста имеют разные единицы и не должны сопоставляться как одна шкала.
Место в рейтинге
В выпуске 2026 H2 MiMo-V2.5 находится на 29-й позиции. Итог рассчитан по методологии 1.0: качество получает вес 40%, человеческое предпочтение — 30%, кодинг — 15%, эффективность — 10%, доступ — 5%. Подробный состав выборки и позиции моделей опубликованы в общем рейтинге ИИ COMRAD404.
Позицию нельзя объяснить одной слабой метрикой. MiMo-V2.5 получает 26,55 балла итогового результата только за человеческое предпочтение и ещё 5 баллов за доступ, но более тяжёлый суббалл качества приносит 23,44. Кодинг и эффективность добавляют соответственно 9 и 5,84. После округления получается COMRAD Score 69,8.
Редакционная интерпретация такова: модель приятнее и убедительнее в диалоге, чем можно ожидать по её независимому индексу общего интеллекта. Это полезно для пользовательских продуктов, но опасно принимать выразительный ответ за доказательство фактической или логической надёжности.
Что показывают пять суббаллов
| Суббалл | Оценка | Вес | Практический смысл |
|---|---|---|---|
| Качество | 58,6 | 40% | Умеренный общий уровень; сложные выводы требуют проверки |
| Human preference | 88,5 | 30% | Сильное восприятие ответов пользователями в слепых парах |
| Кодинг | 60,0 | 15% | Подходит для повседневной разработки, но не выглядит безусловным выбором для самых трудных задач |
| Эффективность | 58,4 | 10% | Хорошая цена не полностью компенсирует средний совокупный профиль задержки и производительности |
| Доступ | 100,0 | 5% | Открытые веса и разрешительная лицензия снимают значительную часть барьеров |
LMArena rating — статистический рейтинг, полученный из слепых попарных сравнений, а не доля верных ответов. Поэтому текстовый рейтинг 1433,9 и суббалл human preference 88,5 говорят о выборе пользователей между ответами, но не измеряют достоверность каждого утверждения. Аналогично Code Arena отражает предпочтение в кодовых сравнениях и не заменяет выполнение тестов в репозитории.
Архитектура и доступ
По официальной карточке MiMo-V2.5 — нативно мультимодальная разреженная Mixture-of-Experts модель. Xiaomi указывает 310 млрд общих и 15 млрд активируемых параметров, отдельные визуальный и аудиоэнкодеры, гибрид Sliding Window Attention и глобального внимания, а также три слоя Multi-Token Prediction. Заявленный максимальный контекст — до 1 млн токенов.
Эти сведения исходят от разработчика и описывают устройство модели, а не независимую оценку её полезности. Отдельная работа команды Xiaomi посвящена оптимизации обслуживания семейства MiMo-V2.5: Hybrid SWA, разреженный MoE и мультимодальные энкодеры снижают часть вычислительных и кеширующих затрат, но требуют специализированной серверной инфраструктуры.
Веса опубликованы на Hugging Face под MIT. Это разрешительная лицензия, поэтому MiMo-V2.5 можно точнее называть моделью с открытыми весами и MIT-лицензией, а не просто закрытым API-сервисом. Репозиторий полной версии занимает сотни гигабайт, а официальный пример развёртывания предусматривает распределённую конфигурацию. Для небольшой команды API или управляемый хостинг обычно окажется проще самостоятельного FP8-развёртывания.
Возможности и сценарии
Модель принимает текст, изображения, видео и аудио, а выводит текст. Официальная API-страница также перечисляет deep thinking, tool calls, streaming, structured output, web search и кеширование контекста. Наличие функции в интерфейсе не гарантирует одинаковую реализацию у каждого стороннего провайдера, поэтому интеграционные возможности следует проверять по конкретному endpoint.
Анализ длинных документов
Контекст 1 050 000 токенов в паспорте делает MiMo-V2.5 кандидатом для обзора договоров, технической документации, журналов событий, транскриптов и больших наборов исходного кода. Однако номинальная вместимость не равна гарантированной способности найти каждую деталь. В тесте нужны факты, расположенные в начале, середине и конце контекста, а также вопросы с конфликтующими фрагментами.
Мультимодальная обработка
Единый запрос может объединять текстовые инструкции с изображениями, аудио и видео. Практические сценарии — разбор записи совещания вместе со слайдами, поиск событий в длинном видео, извлечение данных из сканов, проверка интерфейса по записи экрана. Поскольку ответ текстовый, отдельный генератор изображений, видео или речи модель не заменяет.
Агенты и автоматизация
Поддержка вызова инструментов позволяет использовать модель как планировщик для поиска, работы с файлами, CRM, браузером или внутренними API. Сильное пользовательское предпочтение полезно там, где агент должен понятно объяснять действия. Но перед выдачей прав на запись следует измерить долю лишних вызовов, соблюдение схемы аргументов и способность остановиться при недостатке данных.
Диалоговые продукты
Суббалл human preference 88,5 указывает на хороший потенциал в помощниках, поддержке и интерфейсах вопрос–ответ. Для таких продуктов важны не только знания, но и структура, тон, понятность и следование намерению пользователя. При этом высокий arena-профиль нельзя использовать как основание автоматически разрешить ответы без проверки источников.
Работа с кодом и рассуждением
MiMo-V2.5 поддерживает режим рассуждения и позиционируется Xiaomi как модель для агентных задач. В паспорте кодовый рейтинг LMArena составляет 1437,5 при 56-м месте, а редакционный суббалл кодинга — 60,0. Это рабочий, но не доминирующий результат.
Модель разумно тестировать для генерации небольших функций, объяснения незнакомого кода, подготовки тестов, миграций и первичного поиска дефектов. Для автономного изменения крупного репозитория важнее не качество демонстрационного ответа, а процент задач, после которых проходят компиляция, линтер, unit-тесты и интеграционные проверки.
Artificial Analysis Intelligence Index равен 38,0; значение не является оценочным восстановлением и присутствовало в независимом источнике. В сочетании с quality 58,6 оно предупреждает, что длинная цепочка рассуждений может выглядеть уверенно, но содержать незаметную ошибку. Для расчётов, юридических выводов, безопасности и архитектурных решений нужен внешний верификатор.
Цена и скорость
В зафиксированном измерении ввод стоил $0,112 за миллион токенов, вывод — $0,224. При запросе на 100 000 входных и 5 000 выходных токенов ориентир составит около $0,01232 без учёта кеша, повторных вызовов, мультимодальной тарификации, инструментов и наценки провайдера.
Измеренная скорость — 60,3 выходного токена в секунду, время до первого токена — 1,93 секунды. Это разные характеристики: первая определяет темп после начала генерации, вторая — ощущение задержки до появления ответа. При длинном мультимодальном вводе, включённом рассуждении или высокой нагрузке реальные значения могут отличаться.
Цены и скорость зависят от API-провайдера, региона, кеширования, длины запроса, режима рассуждения и серверной конфигурации. Цифры статьи относятся только к срезу рейтинга на 31 августа 2026 года. На официальной странице Xiaomi опубликован текущий тариф платформы, но он не используется для заднего изменения паспортных значений.
Ограничения
- Умеренное независимое качество. Quality 58,6 и Intelligence Index 38,0 не поддерживают вывод, что модели можно доверять самые сложные задачи без контроля.
- Разрыв между убедительностью и проверяемостью. Ответ может выигрывать слепое сравнение благодаря стилю и полезной подаче, оставаясь фактически неточным.
- Крупное самостоятельное развёртывание. MIT-лицензия упрощает юридический доступ, но не уменьшает требования 310-миллиардной MoE-модели к памяти, сети и обслуживанию.
- Контекст не гарантирует удержание всех фактов. Миллион токенов — лимит вместимости, а не обещание безошибочного поиска и рассуждения по всему объёму.
- Русский язык требует отдельного теста. В метаданных официальной карточки явно перечислены английский и китайский; отдельного официального подтверждения специализации на русском в изученных материалах нет.
- Мультимодальный ввод увеличивает вариативность. Результат зависит от качества изображения, частоты кадров видео, шумов в аудио и правил препроцессинга провайдера.
- Не preview — не то же самое, что production-ready. Паспорт отмечает preview=false, но готовность к эксплуатации определяется SLA, политикой данных, воспроизводимостью и собственными приёмочными испытаниями.
Как проверить на своей задаче
- Соберите 50–200 реальных примеров. Не ограничивайтесь публичными бенчмарками. Включите типичные, редкие и критические случаи, русский язык и данные с плохим качеством.
- Зафиксируйте конфигурацию. Запишите провайдера, endpoint, режим рассуждения, системный промпт, temperature, лимит вывода и дату теста.
- Отделите качество от стиля. Оценщики не должны знать название модели. Проверяйте факты, полноту, формат и полезность отдельными критериями.
- Для кода запускайте проверки. Компиляция, тесты, статический анализ и контроль безопасности должны иметь больший вес, чем субъективное впечатление.
- Проверьте длинный контекст. Разместите контрольные факты на разных расстояниях, добавьте отвлекающие фрагменты и измерьте точность цитирования источника.
- Протестируйте мультимодальность. Используйте мелкий текст на изображениях, длинные видео, несколько говорящих, шум и противоречие между аудио и подписью.
- Измерьте стоимость всей операции. Считайте не только основной ответ, но и повторные попытки, рассуждение, tool calls, кеширование и неуспешные запросы.
- Проведите нагрузочный прогон. Зафиксируйте медиану и 95-й перцентиль времени до первого токена, скорость генерации и частоту ошибок API.
Для агента минимальный приёмочный набор должен дополнительно включать неверные параметры инструментов, недоступный сервис, попытку выполнить необратимое действие и запрос с недостаточными правами. Успешная модель обязана запросить подтверждение или безопасно остановиться.
Кому подойдёт MiMo-V2.5
Хороший выбор: команды, которым нужен недорогой мультимодальный API; разработчики агентов с длинной историей; исследователи открытых весов; проекты, где важны управляемое развёртывание и разрешительная лицензия; пользовательские помощники, для которых существенны понятность и предпочтение аудитории.
Выбор с оговорками: сложные кодовые агенты, автоматический анализ критичных документов, математическое рассуждение и русскоязычные продукты с высокой ценой ошибки. Здесь MiMo-V2.5 может быть экономичным участником пайплайна, но ей нужны тесты, retrieval, исполнение кода или вторая модель-проверяющий.
Неочевидный выбор: локальный запуск без серверной инфраструктуры. Открытые веса дают свободу, однако масштаб модели делает эксплуатационные затраты самостоятельным фактором решения. Сначала стоит сравнить полную стоимость владения с API, а не только цену оборудования.
FAQ
MiMo-V2.5 — модель с открытыми весами?
Да. Xiaomi опубликовала веса MiMo-V2.5 на Hugging Face под разрешительной лицензией MIT. Это позволяет самостоятельное развёртывание и модификацию с соблюдением условий лицензии.
Подходит ли MiMo-V2.5 для программирования?
Подходит для повседневной генерации, объяснения и проверки кода, но суббалл кодинга 60,0 и 56-е место Code Arena не дают оснований считать её безусловным выбором для сложной автономной разработки.
Что означает LMArena Text rating 1433,9?
Это статистический рейтинг по слепым попарным сравнениям ответов. Он не означает 1433 правильных ответа и не является процентом качества.
Можно ли действительно передать модели миллион токенов?
Паспорт фиксирует контекст 1 050 000 токенов, а официальная карточка заявляет до 1 млн. Доступный лимит и поведение на предельной длине зависят от провайдера; удержание всех деталей нужно проверять отдельно.
Поддерживает ли модель изображения, видео и аудио?
Да. Официальная документация указывает нативное понимание текста, изображений, видео и аудио. Выход модели при этом текстовый.
Почему MiMo-V2.5 только на 29-м месте при human preference 88,5?
Потому что итог учитывает пять направлений. Высокое пользовательское предпочтение сочетается с quality 58,6, coding 60,0 и efficiency 58,4, причём качество имеет наибольший вес — 40%.
Источники
- Официальная страница MiMo-V2.5 — модальности, API-возможности, номинальный контекст и актуальная информация платформы.
- Официальное сообщение о серии MiMo-V2.5 — позиционирование модели и сведения о запуске публичной беты 23 апреля 2026 года.
- Журнал выпусков Xiaomi MiMo — дата выпуска и состав возможностей версии MiMo-V2.5.
- Карточка и репозиторий MiMo-V2.5 — веса, MIT-лицензия, архитектура, параметры и инструкции по развёртыванию.
- Full-Pipeline Inference Optimization for MiMo-V2.5 Series — первичный технический материал команды Xiaomi об архитектуре и оптимизации инференса.
- Artificial Analysis LLM Leaderboard — источник Intelligence Index, цены, скорости и контекста в зафиксированном срезе.
- LMArena Text Leaderboard — текстовый рейтинг, место и число голосов.
- LMArena Leaderboard — данные Code Arena, использованные в кодовом суббалле.
Срез статьи: 31 августа 2026 года. Числа рейтинга приведены строго по паспорту COMRAD404; заявления о конструкции и функциях модели атрибутированы Xiaomi, а выводы о выборе и рисках являются редакционной интерпретацией.
