Mistral Medium 2508 — модель для тех, кому важнее удобный универсальный API и хорошая реакция пользователей, чем максимальный итоговый балл или доступ к открытым весам. В срезе COMRAD404 от 31 августа 2026 года она заняла 92-е место с COMRAD Score 61,0 из 100. Профиль неоднородный: редакционная оценка human preference заметно выше качества и coding, а доступность остаётся слабым местом.
Модель известна разработчику как Mistral Medium 3.1, а в API используется идентификатор mistral-medium-2508. Это важное уточнение: число 2508 обозначает версию API и период выпуска, а не отдельную архитектуру с открытой технической спецификацией. В официальной документации модель отмечена как deprecated с датой 22 мая 2026 года, поэтому для новой интеграции её нужно рассматривать осторожно.
Коротко
- Место в COMRAD404: 92.
- COMRAD Score: 61,0 из 100.
- Лучший показатель профиля: human preference — 81,6 из 100.
- Слабые зоны: access — 39,3; quality и coding — по 50,0.
- Рейтинг LMArena Text: 1408,8; место в текстовом рейтинге — 135; число голосов — 92 758.
- Цена в паспорте: 0,40 доллара за миллион входных токенов и 2,00 доллара за миллион выходных токенов.
- Контекст: 131 072 токена в паспорте; официальная страница округляет это значение до 128k.
- Лицензия: Proprietary; open weights отсутствуют.
- Reasoning: в паспорте не заявлен отдельный режим рассуждений.
- Статус: не preview, но официально помечена как deprecated на дату среза.
Практический вывод простой: модель имеет смысл проверять в уже работающих API-сценариях, где ценятся стабильный универсальный диалог, обработка документов и изображений, структурированные ответы или вызов функций. Для нового проекта сначала следует выяснить, допускает ли выбранный провайдер использование именно этой версии и какова политика её дальнейшей поддержки.
Паспорт модели
| Параметр | Значение | Как читать показатель |
|---|---|---|
| Модель | Mistral Medium 2508 | Каноническое имя в паспорте рейтинга |
| API ID | mistral-medium-2508 |
Идентификатор для обращения к модели |
| Разработчик | Mistral | Организация, указанная в паспорте |
| Лицензия | Proprietary | Закрытая лицензия с условиями поставщика |
| Open weights | Нет | Весовые параметры не опубликованы как открытые |
| Reasoning | Нет | Отдельный режим reasoning в срезе не зафиксирован |
| Preview | Нет | В паспорте модель не отнесена к preview |
| Уверенность оценки | Ограниченная | Редакционная характеристика полноты и надёжности профиля |
| Контекст | 131 072 токена | Максимум, указанный в паспорте COMRAD404 |
| Вход / выход | $0,40 / $2,00 за 1 млн токенов | Цена из зафиксированного паспорта, а не универсальная гарантия |
Официальная страница Mistral называет эту версию Mistral Medium 3.1, указывает выпуск в августе 2025 года и контекст 128k. Значение 131 072 в паспорте — точная двоичная форма того же порядка величины. В статье не следует приписывать модели размер параметров, тип архитектуры или сведения о датасете: в переданном срезе и найденных первичных материалах таких данных нет.
Место в рейтинге
92-е место в COMRAD404 означает, что Mistral Medium 2508 находится в нижней части первой сотни моделей этого выпуска, но само по себе место не объясняет причину позиции. Итоговый балл складывается из пяти нормализованных редакционных суббаллов с весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Это не проценты правильных ответов и не прямые вероятности успеха.
Результат 61,0 выглядит сдержанно из-за сочетания quality 50,0 и coding 50,0 с сильным human preference 81,6. Efficiency 70,6 поддерживает модель: при умеренной цене входа она выглядит рационально для массовых API-задач. Но access 39,3 снижает итог, что согласуется с закрытой лицензией и отсутствием открытых весов. При этом нельзя делать вывод, что модель в 39,3% случаев доступна или что она на 50% хороша в программировании: шкала COMRAD404 предназначена для сопоставления профилей внутри рейтинга.
Независимое измерение LMArena Text даёт rating 1408,8, место 135 и 92 758 голосов. LMArena rating — статистическая оценка по слепым попарным сравнениям, а не процент правильных ответов. Разница между местом 92 в COMRAD404 и местом 135 в LMArena Text не является противоречием: рейтинги используют разные методики, наборы сигналов и способы агрегирования.
В паспорте отсутствуют Artificial Analysis Intelligence Index и независимый LMArena Code rating. Поэтому модель нельзя честно позиционировать по этим двум направлениям на основании памяти или результатов другой версии Mistral.
Разбор пяти суббаллов
| Суббалл | Оценка | Интерпретация |
|---|---|---|
| Quality | 50,0 | Средняя редакционная оценка общего качества; не означает 50% точности |
| Human preference | 81,6 | Главная сильная сторона профиля: ответы хорошо воспринимаются в пользовательских сравнениях |
| Coding | 50,0 | Нейтральный уровень в редакционной модели; отдельного LMArena Code rating нет |
| Efficiency | 70,6 | Хорошее соотношение цены и предполагаемой практической полезности в паспорте |
| Access | 39,3 | Ограниченный доступ по совокупности условий лицензии и доступности поставки |
Самая заметная особенность — разрыв между human preference и quality. Его стоит читать как сигнал о том, что модель может давать приятные, понятные и убедительно сформулированные ответы, но это не гарантирует аналогичного уровня на строгих проверках фактов, многошаговой логики или специализированных задачах. Для рабочих процессов с высокой ценой ошибки нужна собственная валидация, особенно если ответы должны быть доказуемыми и воспроизводимыми.
Возможности и сценарии
Официальная карточка Mistral Medium 3.1 указывает мультимодальный профиль и поддержку контекста 128k. В документации для версии mistral-medium-2508 перечислены chat completions, function calling, structured outputs, predicted outputs, Document QnA, batching, Agents & Conversations и встроенные инструменты. Это делает модель не только чат-интерфейсом, но и компонентом прикладного API-конвейера.
Документы и рабочая переписка
Большой контекст подходит для разбора длинных инструкций, внутренних регламентов, технической документации и связанных наборов документов. Модель можно использовать для извлечения полей, составления кратких выводов, подготовки черновиков ответов и классификации обращений. Однако длинное окно не заменяет проверку цитат: при большом объёме входных данных необходимо тестировать, какие фрагменты модель действительно использует.
Структурированные ответы
Structured outputs и function calling удобны для маршрутизации заявок, заполнения карточек CRM, генерации JSON для последующих сервисов и запуска ограниченного набора действий. Надёжность такой схемы зависит не только от модели. Нужны строгая схема, серверная проверка типов, обработка отказов и защита от неожиданных аргументов. Валидный JSON не равен корректному решению задачи.
Изображения и мультимодальные запросы
Мультимодальный статус позволяет рассматривать модель для анализа скриншотов, простых схем, страниц документов и изображений, приложенных к запросу. Перед запуском production-сценария следует отдельно проверить качество на собственных изображениях: разрешение, таблицы, рукописный текст, мелкие подписи и диаграммы часто дают иной результат, чем обычный текстовый prompt.
Агенты и автоматизация
Поддержка агентов и инструментов полезна там, где модель должна выбрать действие, вызвать API и сформировать итог для пользователя. Mistral Medium 2508 может быть промежуточным слоем между интерфейсом и бизнес-системами, но автономность следует ограничивать. Для финансовых операций, удаления данных, отправки писем и изменения записей разумно требовать подтверждение человека или отдельное правило авторизации.
Цена и скорость
В паспорте указана цена 0,40 доллара за миллион входных токенов и 2,00 доллара за миллион выходных токенов. При одинаковом объёме токенов генерация обходится в пять раз дороже чтения входа, поэтому экономия достигается не только выбором модели, но и сокращением повторяющихся инструкций, кешированием неизменных частей контекста и контролем длины ответа.
Пример: запрос с 100 000 входных и 10 000 выходных токенов по паспортным ставкам стоит около 0,24 доллара: 0,04 доллара за вход и 0,20 доллара за выход. Это расчёт по указанным тарифам, а не обещание конечного счёта. Провайдер может применять собственную тарификацию, минимальные объёмы, наценку, плату за инструменты или отличающиеся правила округления.
Показатели output tokens per second и time to first token в паспорте отсутствуют. Поэтому нельзя называть модель быстрой в абсолютных единицах и нельзя строить выводы о задержке интерфейса по цене. Скорость зависит от API-провайдера, региона, очереди, режима потоковой выдачи, длины контекста и текущей нагрузки. Если latency важна, её нужно измерять в том же режиме, в котором будет работать продукт.
Ограничения
- Deprecated-статус. На официальной странице модель отмечена как устаревающая, а в качестве замены указана Mistral Medium 3.5. Для нового продукта это риск изменения доступности, цены или политики поддержки.
- Закрытая лицензия. Proprietary означает, что использование регулируется условиями поставщика. Модель нельзя считать self-hosted решением, а open weights отсутствуют.
- Нет reasoning-режима. В паспорте не заявлен отдельный управляемый режим рассуждений. Для сложных задач нельзя автоматически приписывать модели специализированный reasoning-профиль.
- Неполный набор независимых метрик. Artificial Analysis Intelligence Index и LMArena Code rating отсутствуют. Это ограничивает прямую оценку общего интеллекта и программирования.
- Ограниченная уверенность. Такой статус указан в паспорте и означает, что редакционная интерпретация должна использоваться как ориентир, а не как замена пилотному тесту.
- Риск переноса впечатления на точность. Высокий human preference может отражать ясность и удобство диалога, но не подтверждает фактологическую безошибочность.
- Зависимость от сервиса. Тариф, доступные функции и задержка определяются конкретным API-провайдером и режимом вызова.
Для кого модель подходит
Mistral Medium 2508 разумно включать в короткий список, если команда уже использует Mistral API и хочет получить универсальную модель для текстовых и мультимодальных задач без развёртывания собственных весов. Её профиль особенно уместен для помощников, внутреннего поиска по документам, классификации обращений, подготовки черновиков, извлечения структурированных данных и сценариев с вызовом функций.
Модель менее удобна как базовый выбор для нового долгоживущего продукта, если критичны гарантированный срок поддержки, self-hosting, открытая лицензия, подтверждённая скорость или специализированная генерация кода. В таких случаях сначала нужно проверить замену, доступную у вашего поставщика, но в рамках этого профиля нельзя подставлять в сравнение показатели другой модели, которых нет в паспорте.
Как проверить на своей задаче
- Соберите реальные примеры. Возьмите 50–200 обезличенных запросов из будущего процесса: документы, обращения, изображения, JSON-входы и ошибки пользователей.
- Зафиксируйте критерии. Отдельно оцените фактическую корректность, полноту, стиль, соблюдение формата, выбор инструмента и стоимость. Не объединяйте всё в одно субъективное впечатление.
- Сделайте эталон. Для каждого примера подготовьте правильный ответ, допустимый диапазон и список критичных ошибок. Для извлечения данных проверяйте поля программно.
- Проверьте длинный контекст. Разместите нужный факт в начале, середине и конце документа. Сравните результат при 8k, 32k и близком к предельному объёме.
- Проверьте инструменты. Ограничьте функции схемами и намеренно добавьте неоднозначные запросы. Измерьте ложные вызовы, пропущенные вызовы и неверные аргументы.
- Измерьте деньги и задержку. Записывайте токены, время до первого фрагмента, время полного ответа и долю повторных запросов. Тестируйте именно того API-провайдера и тот режим, которые планируются в эксплуатации.
- Проведите повторный прогон. Используйте несколько запусков с одинаковыми настройками. Оценивайте не только среднее, но и худшие случаи.
- Примите решение по порогу. Модель подходит, если она проходит заранее заданные требования по ошибкам, цене и задержке. Хорошее впечатление от нескольких удачных ответов недостаточно.
Сравнивать результаты собственного теста с рейтингом следует аккуратно. COMRAD Score помогает понять общий профиль, LMArena Text показывает сигнал пользовательских предпочтений, а ваш набор данных отвечает на более узкий вопрос: справляется ли версия mistral-medium-2508 с конкретной работой в конкретной конфигурации.
Что означает статус deprecated
Deprecated не означает, что API обязательно перестал отвечать в день публикации статуса. Это означает, что поставщик считает модель устаревающей и не рекомендует её как основу для новых интеграций. На 31 августа 2026 года официальная карточка Mistral Medium 3.1 указывает дату deprecated 22 мая 2026 года и предлагает Mistral Medium 3.5 как замену.
Для существующей системы это повод проверить уведомления, контракт, лимиты, совместимость формата ответов и план миграции. Для нового проекта следует заранее заложить абстракцию провайдера, контроль версии модели и регрессионный набор тестов, чтобы переход не зависел от визуального сходства названий.
FAQ
Что такое Mistral Medium 2508?
Это API-идентификатор модели, которую официальная документация Mistral называет Mistral Medium 3.1. В паспорте COMRAD404 она указана как Mistral Medium 2508.
Какое место модель заняла в рейтинге COMRAD404?
Модель заняла 92-е место в выпуске COMRAD404 2026 H2 и получила COMRAD Score 61,0 из 100.
Почему у модели высокий human preference, но средние quality и coding?
Суббаллы измеряют разные стороны профиля. Высокий human preference указывает на сильный пользовательский сигнал, но не доказывает такую же надёжность в строгих задачах качества или программирования.
Есть ли у Mistral Medium 2508 открытые веса?
Нет. В паспорте указано open weights: false, а лицензия обозначена как Proprietary.
Сколько стоит модель?
В паспорте указаны 0,40 доллара за миллион входных токенов и 2,00 доллара за миллион выходных токенов. Итоговая цена зависит от API-провайдера и режима тарификации.
Известна ли скорость генерации?
Нет. В срезе отсутствуют output tokens per second и time to first token. Скорость нужно измерять самостоятельно в целевой конфигурации.
Какой у модели размер контекста?
В паспорте COMRAD404 указано 131 072 токена. Официальная документация округляет это значение до 128k.
Стоит ли выбирать модель для нового проекта?
Только после пилотной проверки и оценки риска deprecated-статуса. Для уже работающего Mistral API-сценария модель может быть практичной, но для новой интеграции нужно отдельно проверить доступность и план миграции.
Источники
Рейтинг COMRAD404: методика и выпуск 2026 H2. Числа COMRAD Score, суббаллов и исходного паспорта приведены по переданному редакционному срезу от 31 августа 2026 года.
- Официальная карточка Mistral Medium 3.1 — название модели, API ID, контекст, функции и deprecated-статус.
- Официальный changelog Mistral — дата выпуска Mistral Medium 3.1 и API-идентификатор версии 25.08.
- LMArena Text Leaderboard — независимый текстовый рейтинг и метод попарных пользовательских сравнений.
- Artificial Analysis LLM Leaderboard — источник для проверки Intelligence Index, стоимости, скорости и контекста; для данной модели соответствующий показатель в паспорте отсутствует.
Официальные материалы подтверждают свойства и статус API-модели. Рейтинговые числа и редакционные выводы разделены: LMArena — независимое измерение пользовательских сравнений, а COMRAD Score и пять суббаллов — нормализованные оценки COMRAD404, не проценты качества.
