Запись архива

Релиз Mistral Small 3.1: новая открытая модель с нативной поддержкой инструментов

Mistral AI выпустила Mistral Small 3.1 — компактную модель с 24 млрд параметров, нативной поддержкой вызова функций и мультимодальностью. Разбираем ключевые изменения, бенчмарки и сценарии использования.

Mistral Small 3.1 — официальный анонс модели с мультимодальностью и function calling
Mistral Small 3.1 — официальный анонс модели с мультимодальностью и function calling
Редакционная тематическая обложка COMRAD404

16 апреля 2026 года Mistral AI представила Mistral Small 3.1 — обновление своей компактной открытой модели. Релиз примечателен не столько ростом числа параметров (оно осталось прежним — 24 млрд), сколько архитектурными изменениями: добавлена нативная поддержка вызова функций (function calling) и мультимодальность, то есть возможность обрабатывать изображения наравне с текстом.

Mistral Small 3.1 доступна под лицензией Apache 2.0 на Hugging Face. Размер в bfloat16 — около 48 ГБ, что позволяет запускать модель на потребительских GPU с 24 ГБ памяти (например, RTX 4090 или RTX 5090) с квантизацией.

Что изменилось по сравнению с Mistral Small 3

Базовая версия Mistral Small 3 (январь 2026) была текстовой моделью с окном в 32 768 токенов. Mistral Small 3.1 расширяет контекст до 128 000 токенов и добавляет две ключевые возможности.

Характеристика Mistral Small 3 Mistral Small 3.1
Параметры 24B 24B
Контекстное окно 32 768 токенов 128 000 токенов
Мультимодальность Нет Да (изображения + текст)
Function calling Через системный промпт Нативная поддержка (JSON mode)
Лицензия Apache 2.0 Apache 2.0
Вес модели (bfloat16) ~48 ГБ ~48 ГБ

Нативная поддержка function calling означает, что модель способна самостоятельно определять необходимость вызова внешних инструментов и возвращать структурированные JSON-объекты для интеграции с API. Это отличает её от Mistral Small 3, где для аналогичного поведения требовалась дополнительная настройка промпта.

Бенчмарки: где Mistral Small 3.1 сильнее

Mistral AI приводит результаты тестов по нескольким категориям. Основное улучшение — мультимодальные задачи. На бенчмарке MMMU (мультимодальное понимание) модель показывает 64.2%, что сопоставимо с Qwen2.5-VL-72B (64.5%) при значительно меньшем размере.

Текстовые бенчмарки:

  • MMLU-Pro: 68.4% (против 68.0% у Mistral Small 3)
  • MATH-500: 90.1% (против 80.5% у Mistral Small 3)
  • HumanEval (кодинг): 82.9% (против 78.0% у Mistral Small 3)

По заявлениям разработчиков, Mistral Small 3.1 превосходит Llama 3.3 70B в задачах кодинга и математики при вдвое меньшем количестве параметров. Однако стоит учитывать, что бенчмарки не всегда отражают реальную производительность в специфических сценариях.

Сценарии использования: агенты и автоматизация

Mistral Small 3.1 — это в первую очередь модель для агентных систем. Нативная поддержка function calling упрощает построение цепочек вызовов: модель может сама решать, когда запросить данные из внешнего API, выполнить поиск в базе знаний или вызвать инструмент.

Примеры применения:

  • Чат-боты с интеграцией внешних сервисов (календарь, CRM, база знаний)
  • Агенты для автоматизации рабочих процессов (генерация отчётов, парсинг документов)
  • Мультимодальные ассистенты для работы с изображениями (описание, извлечение текста, анализ схем)

Мультимодальность реализована через Vision Encoder, который обрабатывает изображения с разрешением до 1344 пикселей. Модель не генерирует изображения, но может анализировать их содержание.

Развёртывание и совместимость

Mistral Small 3.1 доступна в форматах для Hugging Face Transformers, vLLM, Text Generation Inference (TGI) и llama.cpp. Для инференса рекомендуется как минимум 24 ГБ видеопамяти.

Пример загрузки через Hugging Face:

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(«mistralai/Mistral-Small-3.1-24B-Instruct-2504»)
tokenizer = AutoTokenizer.from_pretrained(«mistralai/Mistral-Small-3.1-24B-Instruct-2504»)

Для function calling потребуется использовать JSON-режим генерации, который поддерживается в TGI и vLLM.

Ограничения и неизвестные

Несмотря на улучшения, стоит учитывать несколько моментов:

  • Мультимодальность ограничена статическими изображениями — видео и анимации не поддерживаются.
  • Результаты function calling зависят от качества описания инструментов в системном промпте. Mistral AI рекомендует чётко специфицировать входные параметры JSON-схемой.
  • Бенчмарки по кодингу (HumanEval) могут не отражать производительность на сложных многофайловых проектах.
  • Модель не прошла независимую верификацию заявленных показателей сторонними лабораториями — все цифры предоставлены Mistral AI.

Что проверить перед внедрением

Если вы рассматриваете Mistral Small 3.1 для продакшна, стоит:

Протестировать model на ваших данных — заявленные бенчмарки не гарантируют результат на специфических доменах.
2. Проверить совместимость с вашим стеком инференса (vLLM, TGI, llama.cpp).
3. Оценить latency и потребление памяти при работе с контекстом 128K токенов — на практике модель может замедляться на длинных последовательностях.
4. Сравнить с альтернативами: Qwen2.5-72B, Llama 3.3 70B, DeepSeek-V3 — особенно если важен компромисс между качеством и стоимостью инференса.

Исходные материалы: блог Mistral AI, Hugging Face model card, официальные бенчмарки.