
16 апреля 2026 года Mistral AI представила Mistral Small 3.1 — обновление своей компактной открытой модели. Релиз примечателен не столько ростом числа параметров (оно осталось прежним — 24 млрд), сколько архитектурными изменениями: добавлена нативная поддержка вызова функций (function calling) и мультимодальность, то есть возможность обрабатывать изображения наравне с текстом.
Mistral Small 3.1 доступна под лицензией Apache 2.0 на Hugging Face. Размер в bfloat16 — около 48 ГБ, что позволяет запускать модель на потребительских GPU с 24 ГБ памяти (например, RTX 4090 или RTX 5090) с квантизацией.
Что изменилось по сравнению с Mistral Small 3
Базовая версия Mistral Small 3 (январь 2026) была текстовой моделью с окном в 32 768 токенов. Mistral Small 3.1 расширяет контекст до 128 000 токенов и добавляет две ключевые возможности.
| Характеристика | Mistral Small 3 | Mistral Small 3.1 |
|---|---|---|
| Параметры | 24B | 24B |
| Контекстное окно | 32 768 токенов | 128 000 токенов |
| Мультимодальность | Нет | Да (изображения + текст) |
| Function calling | Через системный промпт | Нативная поддержка (JSON mode) |
| Лицензия | Apache 2.0 | Apache 2.0 |
| Вес модели (bfloat16) | ~48 ГБ | ~48 ГБ |
Нативная поддержка function calling означает, что модель способна самостоятельно определять необходимость вызова внешних инструментов и возвращать структурированные JSON-объекты для интеграции с API. Это отличает её от Mistral Small 3, где для аналогичного поведения требовалась дополнительная настройка промпта.
Бенчмарки: где Mistral Small 3.1 сильнее
Mistral AI приводит результаты тестов по нескольким категориям. Основное улучшение — мультимодальные задачи. На бенчмарке MMMU (мультимодальное понимание) модель показывает 64.2%, что сопоставимо с Qwen2.5-VL-72B (64.5%) при значительно меньшем размере.
Текстовые бенчмарки:
- MMLU-Pro: 68.4% (против 68.0% у Mistral Small 3)
- MATH-500: 90.1% (против 80.5% у Mistral Small 3)
- HumanEval (кодинг): 82.9% (против 78.0% у Mistral Small 3)
По заявлениям разработчиков, Mistral Small 3.1 превосходит Llama 3.3 70B в задачах кодинга и математики при вдвое меньшем количестве параметров. Однако стоит учитывать, что бенчмарки не всегда отражают реальную производительность в специфических сценариях.
Сценарии использования: агенты и автоматизация
Mistral Small 3.1 — это в первую очередь модель для агентных систем. Нативная поддержка function calling упрощает построение цепочек вызовов: модель может сама решать, когда запросить данные из внешнего API, выполнить поиск в базе знаний или вызвать инструмент.
Примеры применения:
- Чат-боты с интеграцией внешних сервисов (календарь, CRM, база знаний)
- Агенты для автоматизации рабочих процессов (генерация отчётов, парсинг документов)
- Мультимодальные ассистенты для работы с изображениями (описание, извлечение текста, анализ схем)
Мультимодальность реализована через Vision Encoder, который обрабатывает изображения с разрешением до 1344 пикселей. Модель не генерирует изображения, но может анализировать их содержание.
Развёртывание и совместимость
Mistral Small 3.1 доступна в форматах для Hugging Face Transformers, vLLM, Text Generation Inference (TGI) и llama.cpp. Для инференса рекомендуется как минимум 24 ГБ видеопамяти.
Пример загрузки через Hugging Face:
python
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(«mistralai/Mistral-Small-3.1-24B-Instruct-2504»)
tokenizer = AutoTokenizer.from_pretrained(«mistralai/Mistral-Small-3.1-24B-Instruct-2504»)
Для function calling потребуется использовать JSON-режим генерации, который поддерживается в TGI и vLLM.
Ограничения и неизвестные
Несмотря на улучшения, стоит учитывать несколько моментов:
- Мультимодальность ограничена статическими изображениями — видео и анимации не поддерживаются.
- Результаты function calling зависят от качества описания инструментов в системном промпте. Mistral AI рекомендует чётко специфицировать входные параметры JSON-схемой.
- Бенчмарки по кодингу (HumanEval) могут не отражать производительность на сложных многофайловых проектах.
- Модель не прошла независимую верификацию заявленных показателей сторонними лабораториями — все цифры предоставлены Mistral AI.
Что проверить перед внедрением
Если вы рассматриваете Mistral Small 3.1 для продакшна, стоит:
Протестировать model на ваших данных — заявленные бенчмарки не гарантируют результат на специфических доменах.
2. Проверить совместимость с вашим стеком инференса (vLLM, TGI, llama.cpp).
3. Оценить latency и потребление памяти при работе с контекстом 128K токенов — на практике модель может замедляться на длинных последовательностях.
4. Сравнить с альтернативами: Qwen2.5-72B, Llama 3.3 70B, DeepSeek-V3 — особенно если важен компромисс между качеством и стоимостью инференса.
Исходные материалы: блог Mistral AI, Hugging Face model card, официальные бенчмарки.
