Kimi K2 0711 Preview — модель для тех, кому важнее удобный диалог, длинный контекст и доступ к открытым весам, чем предсказуемая производительность в каждом классе задач. В срезе COMRAD404 на 31 августа 2026 года она занимает 72-е место с COMRAD Score 62,2. Профиль неоднородный: редакционная оценка человеческой предпочтительности заметно выше оценок качества и кодинга, а сама модель помечена как preview с ограниченной уверенностью данных.
Это не повод списывать Kimi K2 0711 Preview со счетов. Модель может быть практичной для текстового помощника, анализа больших документов, черновой автоматизации и агентских сценариев, особенно если команда готова самостоятельно проверить стабильность ответов. Но для критичного production-контура нужно учитывать отсутствие в паспорте данных по скорости, времени до первого токена, Artificial Analysis Intelligence Index и LMArena Code.
Коротко
- Место в COMRAD404: 72.
- COMRAD Score: 62,2 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
- Главный плюс профиля: human preference — 84,0 из 100.
- Слабые зоны: quality и coding получили по 50,0 из 100.
- Контекст: 131 072 токена.
- Цена в паспорте: 0,6 доллара за миллион входных токенов и 2,5 доллара за миллион выходных.
- Скорость: данных о tokens per second и time to first token в срезе нет.
- Статус: preview; reasoning в паспорте отмечен как false.
- Лицензия: Modified MIT; открытые веса доступны, но это не означает автоматически статус открытого программного обеспечения без лицензионных ограничений.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Название | Kimi K2 0711 Preview |
| Разработчик | Moonshot |
| Канонический идентификатор | kimi-k2-0711-preview |
| Место в COMRAD404 | 72 |
| COMRAD Score | 62,2 из 100 |
| Статус | Preview |
| Reasoning | Нет в профиле модели |
| Открытые веса | Да |
| Лицензия | Modified MIT |
| Контекст | 131 072 токена |
| Уверенность оценки | Ограниченная |
Паспорт описывает именно вариант kimi-k2-0711-preview. В найденных официальных материалах Moonshot основное описание относится к семейству Kimi K2 и к вариантам Base и Instruct. Поэтому архитектурные и benchmark-заявления из общего репозитория нельзя автоматически считать отдельным доказательством характеристик конкретного preview-идентификатора. Для этой статьи приоритет имеют значения переданного паспорта.
Место в рейтинге
72-е место показывает, что Kimi K2 0711 Preview находится в середине общего списка COMRAD404, а не в его верхнем эшелоне. Однако одна позиция не описывает модель полностью. COMRAD Score 62,2 сформирован из нескольких нормализованных редакционных оценок с разными весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%.
Наиболее заметный элемент профиля — human preference 84,0. Это означает, что по редакционной шкале модель хорошо воспринимается в пользовательском взаимодействии: ответы могут казаться уместными, связными и удобными для продолжения диалога. Но этот суббалл не равен точности фактов и не заменяет специализированные тесты.
Quality и coding получили по 50,0. В практическом смысле это сигнал не использовать общий рейтинг как гарантию экспертной точности или надёжного исправления кода. Модель может успешно решать отдельные задачи, но паспорт не подтверждает устойчивое преимущество в этих направлениях.
Efficiency 65,4 выглядит более сбалансированно, однако его нельзя напрямую переводить в скорость генерации: в исходных метриках отсутствуют output tokens per second и time to first token. Access 59,3 указывает на среднюю доступность с точки зрения редакционной методики, но конкретные условия зависят от провайдера, региона, лимитов и режима API.
Что говорят независимые измерения
Единственная независимая рейтинговая метрика, доступная для этой модели в паспорте, — LMArena Text. Kimi K2 0711 Preview имеет рейтинг 1417,6, занимает 117-е место в текстовом лидерборде и представлен в 27 023 пользовательских голосах.
LMArena rating — это статистический рейтинг, рассчитанный по слепым попарным сравнениям, а не процент правильных ответов. Он полезен для оценки того, как модель воспринимается участниками сравнений в диалоговых задачах, но не сообщает напрямую долю верных решений, скорость или стоимость эксплуатации.
Данных по LMArena Code в зафиксированном срезе нет. Artificial Analysis Intelligence Index также отсутствует, и его значение не следует восстанавливать по другим рейтингам. Такое отсутствие снижает полноту профиля и является одной из причин, по которым редакционная уверенность отмечена как ограниченная.
Разбор пяти суббаллов
| Суббалл | Оценка | Как читать показатель |
|---|---|---|
| Quality | 50,0 из 100 | Нет основания считать модель универсально сильной по качеству; обязательна проверка на целевых задачах. |
| Human preference | 84,0 из 100 | Самая сильная часть профиля: удобство и привлекательность ответов в пользовательском взаимодействии. |
| Coding | 50,0 из 100 | Подходит для черновой помощи, но не даёт редакционной гарантии качества программного результата. |
| Efficiency | 65,4 из 100 | Умеренно положительная оценка совокупной эффективности, не равная измеренной скорости. |
| Access | 59,3 из 100 | Доступность оценивается как средняя; условия подключения и тарифы могут различаться. |
Суббаллы — нормализованные оценки COMRAD404 в диапазоне от 0 до 100. Это не проценты качества и не вероятности успешного выполнения запроса. Их задача — показать относительный профиль модели внутри редакционной методики.
Возможности и сценарии
Профиль Kimi K2 0711 Preview лучше всего раскрывается в задачах, где важны связный диалог, работа с большим объёмом входных данных и приемлемая стоимость. Контекст в 131 072 токена позволяет проектировать запросы с крупными документами, длинной историей переписки, несколькими файлами или расширенными инструкциями. Сам размер контекста не гарантирует одинаково качественное использование каждой его части, поэтому на реальных материалах нужно отдельно проверять извлечение фактов из начала, середины и конца документа.
Текстовый помощник
Высокий human preference делает модель кандидатом для черновиков, редакторской поддержки, классификации обращений, переформулирования и подготовки вариантов ответа. Особенно разумен режим, в котором человек утверждает результат, а модель ускоряет первый проход.
Документы и длинные инструкции
Большой контекст удобен для суммаризации договоров, технических регламентов, проектной документации и внутренних баз знаний. Лучше просить модель ссылаться на конкретные фрагменты входного текста, отделять найденное от вывода и сообщать о пропусках.
Автоматизация с инструментами
Официальный репозиторий Moonshot описывает Kimi K2 как семейство с фокусом на tool use и агентские сценарии, а также приводит примеры tool calling для варианта Instruct. Это подтверждает направление разработки, но не является независимым измерением именно Kimi K2 0711 Preview. Перед интеграцией следует проверить схему вызовов, обработку ошибок, повторные запросы и поведение при неверных аргументах.
Кодинг
Модель можно использовать для объяснения кода, генерации тестов, поиска очевидных ошибок и подготовки небольших патчей. При этом coding-суббалл равен 50,0, а LMArena Code в паспорте отсутствует. Поэтому безопасная схема — запускать результат через тесты, линтеры, статический анализ и ревью, а не принимать код непосредственно из ответа.
Цена и скорость
В зафиксированном паспорте указана цена 0,6 доллара за миллион входных токенов и 2,5 доллара за миллион выходных токенов. Это разные единицы тарификации: стоимость входа нельзя сравнивать со стоимостью выхода как с одинаковыми величинами. При длинных документах итоговый счёт зависит от размера контекста, повторной передачи истории, кэширования и доли сгенерированного текста.
Цены относятся к конкретному API-провайдеру и режиму, поэтому их нельзя считать неизменным свойством модели. Перед запуском проекта нужно сверить актуальный тариф, минимальные списания, лимиты, правила кэширования, доступность региона и возможные различия между совместимыми API.
Данные о скорости генерации и времени до первого токена в срезе отсутствуют. Это важное ограничение для чат-интерфейсов и потоковой обработки: по одному только COMRAD Score нельзя обещать конкретную задержку или throughput. Скорость нужно измерить самостоятельно на выбранном провайдере с вашим размером запроса и уровнем параллелизма.
Открытые веса и лицензия
В паспорте указано, что у модели есть открытые веса, а лицензия обозначена как Modified MIT. Официальный репозиторий Moonshot также публикует Modified MIT License. Это расширяет возможности для самостоятельного развёртывания и экспериментов, но термин «открытые веса» не равен утверждению «полностью открытое ПО»: лицензия может содержать дополнительные условия для производных систем и коммерческого использования.
В тексте лицензии репозитория указано специальное условие для коммерческих продуктов или сервисов с более чем 100 миллионами ежемесячно активных пользователей либо выручкой свыше 20 миллионов долларов в месяц: интерфейс такого продукта должен заметно отображать обозначение «Kimi K2». Юридическую применимость условия к конкретному проекту следует проверять с юристом. Также нужно отдельно изучить условия используемого API-провайдера, если веса не разворачиваются самостоятельно.
Ограничения
- Preview-статус. Модель не следует автоматически считать production-ready. Возможны изменения поведения, доступности, совместимости и тарифов.
- Ограниченная уверенность. Паспорт прямо отмечает ограниченную confidence, поэтому итоговую оценку нужно воспринимать как менее устойчивую, чем профиль с полным набором источников.
- Нет reasoning-режима в профиле. В паспорте reasoning отмечен как false. Нельзя обещать скрытый режим длительного пошагового рассуждения или приписывать модели свойства thinking-версий.
- Неполный benchmark-профиль. Нет Artificial Analysis Intelligence Index и метрик LMArena Code.
- Нет данных по задержке. Отсутствуют output tokens per second и time to first token.
- Код требует контроля. Средняя редакционная оценка coding не заменяет тестирование на репозитории, включая работу с зависимостями и существующей архитектурой.
- Контекст не равен памяти. 131 072 токена — лимит контекста, а не гарантия равномерного внимания к каждому фрагменту.
Кому подойдёт модель
Kimi K2 0711 Preview имеет смысл рассматривать командам, которым нужен недорогой текстовый API с длинным контекстом и возможностью изучать вариант с открытыми весами. Это может быть внутренний помощник для документов, прототип классификатора, генератор черновиков или компонент полуавтоматического workflow с обязательной проверкой результата.
Модель хуже подходит как единственный слой контроля фактов, как безусловный генератор production-кода или как сервис, для которого заранее критичны строгие SLA по задержке. В этих случаях отсутствие скорости в паспорте и preview-статус должны быть не сноской, а отдельным пунктом риск-анализа.
Как проверить на своей задаче
- Соберите репрезентативный набор. Возьмите 30–100 реальных запросов: простых, пограничных и заведомо сложных. Не ограничивайтесь демонстрационными примерами.
- Зафиксируйте критерии. Для текста измеряйте фактическую точность, полноту, стиль и число правок. Для кода — прохождение тестов, регрессии, качество diff и долю ручных исправлений.
- Проверьте длинный контекст. Разместите контрольные факты в начале, середине и конце документа. Попросите не только пересказать материал, но и привести подтверждающие фрагменты.
- Проведите повторные запуски. Один удачный ответ не показывает стабильность. Повторите каждый важный тест с одинаковыми параметрами и отдельно проверьте чувствительность к температуре.
- Измерьте стоимость. Запишите число входных и выходных токенов, долю повторной истории и число ретраев. Используйте тариф конкретного провайдера, а не абстрактную цену модели.
- Измерьте скорость. Зафиксируйте время до первого токена, полный latency и скорость выдачи на типовых запросах при одной и нескольких параллельных сессиях.
- Проверьте отказы. Добавьте неоднозначные инструкции, отсутствующие данные, конфликтующие требования, неверные параметры инструментов и запросы на опасные действия.
- Сравните с текущей системой. Сопоставляйте не чужие рейтинговые числа, а стоимость решения задачи, процент успешных ответов и объём последующей работы.
Минимальный пилот для этой модели — две независимые выборки: текстовая и кодовая. Так можно проверить, соответствует ли высокая пользовательская воспринимаемость реальной пользе именно в вашем процессе, а не только в диалоговом сравнении.
FAQ
Что означает 72-е место Kimi K2 0711 Preview?
Это позиция модели в рейтинге COMRAD404 за редакционный срез 2026 H2, зафиксированный 31 августа 2026 года. Место не является процентом качества и не описывает одну конкретную способность.
Можно ли считать COMRAD Score 62,2 процентом правильных ответов?
Нет. COMRAD Score и пять суббаллов — нормализованные редакционные оценки от 0 до 100. Они агрегируют разные аспекты профиля и не равны accuracy.
Что означает рейтинг LMArena 1417,6?
Это статистический рейтинг по слепым попарным сравнениям текстовых ответов. Он не означает, что модель правильно отвечает на 1417,6 условных вопросов, и не является процентом.
Есть ли у модели длинный контекст?
Да. В паспорте указан контекст 131 072 токена. Это максимальный размер контекстного окна в зафиксированном профиле, а не гарантия одинаковой точности на всей длине.
Сколько стоит Kimi K2 0711 Preview?
В паспорте указаны 0,6 доллара за миллион входных токенов и 2,5 доллара за миллион выходных. Итоговая стоимость зависит от провайдера, режима, длины запросов, истории и действующих тарифных условий.
Известна ли скорость модели?
Нет, в данном срезе отсутствуют значения output tokens per second и time to first token. Их нужно измерять на конкретном API или локальной инфраструктуре.
Можно ли сразу использовать модель в production?
Автоматически — нет. В паспорте модель отмечена как preview, поэтому перед production-развёртыванием нужны пилот, мониторинг, тесты на отказоустойчивость и проверка условий провайдера и лицензии.
Источники
Редакционные позиции, COMRAD Score, суббаллы и все числовые значения рейтингового среза взяты из переданного паспорта модели. Для проверки методики и текущей позиции используйте общий рейтинг COMRAD404.
- Страница модели Kimi K2 0711 Preview — официальный материал Moonshot о семействе Kimi K2 и заявленных возможностях.
- Репозиторий MoonshotAI/Kimi-K2 — официальный репозиторий с описанием семейства, примерами развёртывания и использования.
- Modified MIT License в репозитории — текст лицензионных условий для кода и весов.
- LMArena Text Leaderboard — независимый источник для текстового рейтинга и попарных сравнений.
- Artificial Analysis: LLM Leaderboard — источник для Intelligence Index, стоимости, скорости и контекста; значение для этой модели в переданном срезе отсутствует.
Редакционная оговорка: официальный репозиторий и страница Moonshot описывают семейство Kimi K2 и связанные варианты. Они не заменяют отсутствующие в паспорте метрики конкретного preview-идентификатора и не позволяют восстановить их по данным другой версии.
