Запись архива

Mistral Medium 2508: обзор, рейтинг и практическая оценка

Mistral Medium 2508 заняла 92-е место в рейтинге COMRAD404. Модель сильнее выглядит в пользовательских предпочтениях, чем в сводной оценке качества, а её выбор ограничивают закрытая лицензия, отсутствие reasoning-режима и статус deprecated.

Mistral Medium 2508 — профиль модели, рейтинг COMRAD404 и ключевые ограничения API

Mistral Medium 2508 — модель для тех, кому важнее удобный универсальный API и хорошая реакция пользователей, чем максимальный итоговый балл или доступ к открытым весам. В срезе COMRAD404 от 31 августа 2026 года она заняла 92-е место с COMRAD Score 61,0 из 100. Профиль неоднородный: редакционная оценка human preference заметно выше качества и coding, а доступность остаётся слабым местом.

Модель известна разработчику как Mistral Medium 3.1, а в API используется идентификатор mistral-medium-2508. Это важное уточнение: число 2508 обозначает версию API и период выпуска, а не отдельную архитектуру с открытой технической спецификацией. В официальной документации модель отмечена как deprecated с датой 22 мая 2026 года, поэтому для новой интеграции её нужно рассматривать осторожно.

Коротко

  • Место в COMRAD404: 92.
  • COMRAD Score: 61,0 из 100.
  • Лучший показатель профиля: human preference — 81,6 из 100.
  • Слабые зоны: access — 39,3; quality и coding — по 50,0.
  • Рейтинг LMArena Text: 1408,8; место в текстовом рейтинге — 135; число голосов — 92 758.
  • Цена в паспорте: 0,40 доллара за миллион входных токенов и 2,00 доллара за миллион выходных токенов.
  • Контекст: 131 072 токена в паспорте; официальная страница округляет это значение до 128k.
  • Лицензия: Proprietary; open weights отсутствуют.
  • Reasoning: в паспорте не заявлен отдельный режим рассуждений.
  • Статус: не preview, но официально помечена как deprecated на дату среза.

Практический вывод простой: модель имеет смысл проверять в уже работающих API-сценариях, где ценятся стабильный универсальный диалог, обработка документов и изображений, структурированные ответы или вызов функций. Для нового проекта сначала следует выяснить, допускает ли выбранный провайдер использование именно этой версии и какова политика её дальнейшей поддержки.

Паспорт модели

Параметр Значение Как читать показатель
Модель Mistral Medium 2508 Каноническое имя в паспорте рейтинга
API ID mistral-medium-2508 Идентификатор для обращения к модели
Разработчик Mistral Организация, указанная в паспорте
Лицензия Proprietary Закрытая лицензия с условиями поставщика
Open weights Нет Весовые параметры не опубликованы как открытые
Reasoning Нет Отдельный режим reasoning в срезе не зафиксирован
Preview Нет В паспорте модель не отнесена к preview
Уверенность оценки Ограниченная Редакционная характеристика полноты и надёжности профиля
Контекст 131 072 токена Максимум, указанный в паспорте COMRAD404
Вход / выход $0,40 / $2,00 за 1 млн токенов Цена из зафиксированного паспорта, а не универсальная гарантия

Официальная страница Mistral называет эту версию Mistral Medium 3.1, указывает выпуск в августе 2025 года и контекст 128k. Значение 131 072 в паспорте — точная двоичная форма того же порядка величины. В статье не следует приписывать модели размер параметров, тип архитектуры или сведения о датасете: в переданном срезе и найденных первичных материалах таких данных нет.

Место в рейтинге

92-е место в COMRAD404 означает, что Mistral Medium 2508 находится в нижней части первой сотни моделей этого выпуска, но само по себе место не объясняет причину позиции. Итоговый балл складывается из пяти нормализованных редакционных суббаллов с весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%. Это не проценты правильных ответов и не прямые вероятности успеха.

Результат 61,0 выглядит сдержанно из-за сочетания quality 50,0 и coding 50,0 с сильным human preference 81,6. Efficiency 70,6 поддерживает модель: при умеренной цене входа она выглядит рационально для массовых API-задач. Но access 39,3 снижает итог, что согласуется с закрытой лицензией и отсутствием открытых весов. При этом нельзя делать вывод, что модель в 39,3% случаев доступна или что она на 50% хороша в программировании: шкала COMRAD404 предназначена для сопоставления профилей внутри рейтинга.

Независимое измерение LMArena Text даёт rating 1408,8, место 135 и 92 758 голосов. LMArena rating — статистическая оценка по слепым попарным сравнениям, а не процент правильных ответов. Разница между местом 92 в COMRAD404 и местом 135 в LMArena Text не является противоречием: рейтинги используют разные методики, наборы сигналов и способы агрегирования.

В паспорте отсутствуют Artificial Analysis Intelligence Index и независимый LMArena Code rating. Поэтому модель нельзя честно позиционировать по этим двум направлениям на основании памяти или результатов другой версии Mistral.

Разбор пяти суббаллов

Суббалл Оценка Интерпретация
Quality 50,0 Средняя редакционная оценка общего качества; не означает 50% точности
Human preference 81,6 Главная сильная сторона профиля: ответы хорошо воспринимаются в пользовательских сравнениях
Coding 50,0 Нейтральный уровень в редакционной модели; отдельного LMArena Code rating нет
Efficiency 70,6 Хорошее соотношение цены и предполагаемой практической полезности в паспорте
Access 39,3 Ограниченный доступ по совокупности условий лицензии и доступности поставки

Самая заметная особенность — разрыв между human preference и quality. Его стоит читать как сигнал о том, что модель может давать приятные, понятные и убедительно сформулированные ответы, но это не гарантирует аналогичного уровня на строгих проверках фактов, многошаговой логики или специализированных задачах. Для рабочих процессов с высокой ценой ошибки нужна собственная валидация, особенно если ответы должны быть доказуемыми и воспроизводимыми.

Возможности и сценарии

Официальная карточка Mistral Medium 3.1 указывает мультимодальный профиль и поддержку контекста 128k. В документации для версии mistral-medium-2508 перечислены chat completions, function calling, structured outputs, predicted outputs, Document QnA, batching, Agents & Conversations и встроенные инструменты. Это делает модель не только чат-интерфейсом, но и компонентом прикладного API-конвейера.

Документы и рабочая переписка

Большой контекст подходит для разбора длинных инструкций, внутренних регламентов, технической документации и связанных наборов документов. Модель можно использовать для извлечения полей, составления кратких выводов, подготовки черновиков ответов и классификации обращений. Однако длинное окно не заменяет проверку цитат: при большом объёме входных данных необходимо тестировать, какие фрагменты модель действительно использует.

Структурированные ответы

Structured outputs и function calling удобны для маршрутизации заявок, заполнения карточек CRM, генерации JSON для последующих сервисов и запуска ограниченного набора действий. Надёжность такой схемы зависит не только от модели. Нужны строгая схема, серверная проверка типов, обработка отказов и защита от неожиданных аргументов. Валидный JSON не равен корректному решению задачи.

Изображения и мультимодальные запросы

Мультимодальный статус позволяет рассматривать модель для анализа скриншотов, простых схем, страниц документов и изображений, приложенных к запросу. Перед запуском production-сценария следует отдельно проверить качество на собственных изображениях: разрешение, таблицы, рукописный текст, мелкие подписи и диаграммы часто дают иной результат, чем обычный текстовый prompt.

Агенты и автоматизация

Поддержка агентов и инструментов полезна там, где модель должна выбрать действие, вызвать API и сформировать итог для пользователя. Mistral Medium 2508 может быть промежуточным слоем между интерфейсом и бизнес-системами, но автономность следует ограничивать. Для финансовых операций, удаления данных, отправки писем и изменения записей разумно требовать подтверждение человека или отдельное правило авторизации.

Цена и скорость

В паспорте указана цена 0,40 доллара за миллион входных токенов и 2,00 доллара за миллион выходных токенов. При одинаковом объёме токенов генерация обходится в пять раз дороже чтения входа, поэтому экономия достигается не только выбором модели, но и сокращением повторяющихся инструкций, кешированием неизменных частей контекста и контролем длины ответа.

Пример: запрос с 100 000 входных и 10 000 выходных токенов по паспортным ставкам стоит около 0,24 доллара: 0,04 доллара за вход и 0,20 доллара за выход. Это расчёт по указанным тарифам, а не обещание конечного счёта. Провайдер может применять собственную тарификацию, минимальные объёмы, наценку, плату за инструменты или отличающиеся правила округления.

Показатели output tokens per second и time to first token в паспорте отсутствуют. Поэтому нельзя называть модель быстрой в абсолютных единицах и нельзя строить выводы о задержке интерфейса по цене. Скорость зависит от API-провайдера, региона, очереди, режима потоковой выдачи, длины контекста и текущей нагрузки. Если latency важна, её нужно измерять в том же режиме, в котором будет работать продукт.

Ограничения

  • Deprecated-статус. На официальной странице модель отмечена как устаревающая, а в качестве замены указана Mistral Medium 3.5. Для нового продукта это риск изменения доступности, цены или политики поддержки.
  • Закрытая лицензия. Proprietary означает, что использование регулируется условиями поставщика. Модель нельзя считать self-hosted решением, а open weights отсутствуют.
  • Нет reasoning-режима. В паспорте не заявлен отдельный управляемый режим рассуждений. Для сложных задач нельзя автоматически приписывать модели специализированный reasoning-профиль.
  • Неполный набор независимых метрик. Artificial Analysis Intelligence Index и LMArena Code rating отсутствуют. Это ограничивает прямую оценку общего интеллекта и программирования.
  • Ограниченная уверенность. Такой статус указан в паспорте и означает, что редакционная интерпретация должна использоваться как ориентир, а не как замена пилотному тесту.
  • Риск переноса впечатления на точность. Высокий human preference может отражать ясность и удобство диалога, но не подтверждает фактологическую безошибочность.
  • Зависимость от сервиса. Тариф, доступные функции и задержка определяются конкретным API-провайдером и режимом вызова.

Для кого модель подходит

Mistral Medium 2508 разумно включать в короткий список, если команда уже использует Mistral API и хочет получить универсальную модель для текстовых и мультимодальных задач без развёртывания собственных весов. Её профиль особенно уместен для помощников, внутреннего поиска по документам, классификации обращений, подготовки черновиков, извлечения структурированных данных и сценариев с вызовом функций.

Модель менее удобна как базовый выбор для нового долгоживущего продукта, если критичны гарантированный срок поддержки, self-hosting, открытая лицензия, подтверждённая скорость или специализированная генерация кода. В таких случаях сначала нужно проверить замену, доступную у вашего поставщика, но в рамках этого профиля нельзя подставлять в сравнение показатели другой модели, которых нет в паспорте.

Как проверить на своей задаче

  1. Соберите реальные примеры. Возьмите 50–200 обезличенных запросов из будущего процесса: документы, обращения, изображения, JSON-входы и ошибки пользователей.
  2. Зафиксируйте критерии. Отдельно оцените фактическую корректность, полноту, стиль, соблюдение формата, выбор инструмента и стоимость. Не объединяйте всё в одно субъективное впечатление.
  3. Сделайте эталон. Для каждого примера подготовьте правильный ответ, допустимый диапазон и список критичных ошибок. Для извлечения данных проверяйте поля программно.
  4. Проверьте длинный контекст. Разместите нужный факт в начале, середине и конце документа. Сравните результат при 8k, 32k и близком к предельному объёме.
  5. Проверьте инструменты. Ограничьте функции схемами и намеренно добавьте неоднозначные запросы. Измерьте ложные вызовы, пропущенные вызовы и неверные аргументы.
  6. Измерьте деньги и задержку. Записывайте токены, время до первого фрагмента, время полного ответа и долю повторных запросов. Тестируйте именно того API-провайдера и тот режим, которые планируются в эксплуатации.
  7. Проведите повторный прогон. Используйте несколько запусков с одинаковыми настройками. Оценивайте не только среднее, но и худшие случаи.
  8. Примите решение по порогу. Модель подходит, если она проходит заранее заданные требования по ошибкам, цене и задержке. Хорошее впечатление от нескольких удачных ответов недостаточно.

Сравнивать результаты собственного теста с рейтингом следует аккуратно. COMRAD Score помогает понять общий профиль, LMArena Text показывает сигнал пользовательских предпочтений, а ваш набор данных отвечает на более узкий вопрос: справляется ли версия mistral-medium-2508 с конкретной работой в конкретной конфигурации.

Что означает статус deprecated

Deprecated не означает, что API обязательно перестал отвечать в день публикации статуса. Это означает, что поставщик считает модель устаревающей и не рекомендует её как основу для новых интеграций. На 31 августа 2026 года официальная карточка Mistral Medium 3.1 указывает дату deprecated 22 мая 2026 года и предлагает Mistral Medium 3.5 как замену.

Для существующей системы это повод проверить уведомления, контракт, лимиты, совместимость формата ответов и план миграции. Для нового проекта следует заранее заложить абстракцию провайдера, контроль версии модели и регрессионный набор тестов, чтобы переход не зависел от визуального сходства названий.

FAQ

Что такое Mistral Medium 2508?

Это API-идентификатор модели, которую официальная документация Mistral называет Mistral Medium 3.1. В паспорте COMRAD404 она указана как Mistral Medium 2508.

Какое место модель заняла в рейтинге COMRAD404?

Модель заняла 92-е место в выпуске COMRAD404 2026 H2 и получила COMRAD Score 61,0 из 100.

Почему у модели высокий human preference, но средние quality и coding?

Суббаллы измеряют разные стороны профиля. Высокий human preference указывает на сильный пользовательский сигнал, но не доказывает такую же надёжность в строгих задачах качества или программирования.

Есть ли у Mistral Medium 2508 открытые веса?

Нет. В паспорте указано open weights: false, а лицензия обозначена как Proprietary.

Сколько стоит модель?

В паспорте указаны 0,40 доллара за миллион входных токенов и 2,00 доллара за миллион выходных токенов. Итоговая цена зависит от API-провайдера и режима тарификации.

Известна ли скорость генерации?

Нет. В срезе отсутствуют output tokens per second и time to first token. Скорость нужно измерять самостоятельно в целевой конфигурации.

Какой у модели размер контекста?

В паспорте COMRAD404 указано 131 072 токена. Официальная документация округляет это значение до 128k.

Стоит ли выбирать модель для нового проекта?

Только после пилотной проверки и оценки риска deprecated-статуса. Для уже работающего Mistral API-сценария модель может быть практичной, но для новой интеграции нужно отдельно проверить доступность и план миграции.

Источники

Рейтинг COMRAD404: методика и выпуск 2026 H2. Числа COMRAD Score, суббаллов и исходного паспорта приведены по переданному редакционному срезу от 31 августа 2026 года.

Официальные материалы подтверждают свойства и статус API-модели. Рейтинговые числа и редакционные выводы разделены: LMArena — независимое измерение пользовательских сравнений, а COMRAD Score и пять суббаллов — нормализованные оценки COMRAD404, не проценты качества.