Kimi K2.6 — выбор для тех, кому важны высокая оценка пользователями, кодирование и длинный контекст, но не нужна модель с безусловно сильным результатом по всем редакционным направлениям. В срезе COMRAD404 2026 H2 она получила 68,6 балла и заняла 33-е место. Главная особенность профиля — очень высокий суббалл human preference: 95,9 из 100. При этом quality оценивается заметно скромнее — 50,0, а эффективность — 54,1.
Такое сочетание делает Kimi K2.6 не универсальным победителем рейтинга, а практичной моделью для задач, где важны удобство ответа, работа с кодом, большой объём входных данных и возможность использовать open weights. Для выбора API или локального развёртывания нужно отдельно проверить совместимость инструментов: цена и доступность зависят от провайдера, а в редакционном срезе нет измерений скорости генерации и задержки первого токена.
Коротко
- Разработчик: Moonshot.
- Итог COMRAD Score: 68,6 из 100; это нормализованная редакционная оценка, а не процент правильных ответов.
- Позиция: 33-е место в выпуске COMRAD404 2026 H2.
- Лучший показатель профиля: human preference — 95,9.
- Кодирование: 73,8 по редакционной шкале; в Code Arena — rating 1508,7 и 35-е место.
- Контекст: 262 144 токена.
- Цена в паспорте: $0,95 за 1 млн входных токенов и $4,00 за 1 млн выходных токенов.
- Скорость: данных о токенах в секунду и time to first token в срезе нет.
- Лицензия: Modified MIT; open weights указаны как доступные, но это не означает автоматически статус полностью свободного ПО.
Официальные материалы Moonshot описывают Kimi K2.6 как модель для агентных, кодовых и визуальных задач, а документация API указывает на поддержку текстовых, графических и видеовходов, а также режимов с размышлением и без него. Однако в паспорте COMRAD404 поле reasoning имеет значение false. Поэтому редакционный рейтинг не следует трактовать как подтверждение отдельного reasoning-режима: это заявленная функция официальной платформы, а не компонент текущей оценки модели.
Место в рейтинге
В общем рейтинге COMRAD404 Kimi K2.6 находится на 33-й позиции. Итоговый балл рассчитывается с учётом пяти нормализованных суббаллов: quality имеет вес 0,40, human preference — 0,30, coding — 0,15, efficiency — 0,10, access — 0,05. Такой набор весов объясняет, почему высокий результат по предпочтениям пользователей заметно поддерживает итог, но не компенсирует полностью средние значения качества и эффективности.
Для контекста редакционный паспорт отдельно фиксирует результаты LMArena. В Text Arena Kimi K2.6 получила rating 1460,7, заняла 49-е место и была представлена в 37 545 слепых попарных сравнениях. В Code Arena рейтинг составил 1508,7 при 35-м месте. LMArena rating — статистический показатель предпочтения в попарных сравнениях, а не доля правильных ответов и не процент качества.
Эти позиции нельзя смешивать с 33-м местом COMRAD404. COMRAD404 объединяет несколько групп показателей и редакционные нормализации, тогда как LMArena показывает положение модели в конкретной арене и в конкретном типе задач. Разрыв между текстовой и кодовой аренами у Kimi K2.6 выглядит логично для модели, у которой coding subscore выше quality subscore, но сам по себе не доказывает превосходство в каждом виде программирования.
В паспорте нет Artificial Analysis Intelligence Index. Следовательно, для этой модели нельзя указывать такой индекс, восстанавливать его по другим бенчмаркам или делать вывод о месте Kimi K2.6 в Artificial Analysis на основании одного только COMRAD Score.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Модель | Kimi K2.6 |
| Организация | Moonshot |
| Лицензия | Modified MIT |
| Open weights | Да |
| Reasoning в паспорте | Нет |
| Preview | Нет |
| Уверенность оценки | Средняя |
| Контекст | 262 144 токена |
| Входная цена | $0,95 за 1 млн токенов |
| Выходная цена | $4,00 за 1 млн токенов |
| Output tokens/s | Нет данных |
| Time to first token | Нет данных |
Разбор пяти суббаллов
| Суббалл | Оценка | Вес | Что это означает |
|---|---|---|---|
| Quality | 50,0 | 0,40 | Базовая универсальность заметно ограничивает итоговый результат. |
| Human preference | 95,9 | 0,30 | Сильная сторона в слепых пользовательских сравнениях и восприятии ответов. |
| Coding | 73,8 | 0,15 | Хороший редакционный профиль для программирования и инженерных задач. |
| Efficiency | 54,1 | 0,10 | Нет убедительного преимущества по совокупности стоимости и измеренной скорости. |
| Access | 67,9 | 0,05 | Доступность оценивается положительно, но не как максимальная. |
Суббаллы — редакционные нормализованные оценки от 0 до 100. Они не являются процентами качества, точностью на тесте или вероятностью успешного выполнения задачи. Для принятия решения их полезно читать как профиль: Kimi K2.6 заметно лучше выглядит там, где пользовательская полезность и кодирование важнее абсолютной универсальности.
Возможности и сценарии
Практическая зона применения Kimi K2.6 — длинные рабочие запросы, в которых модель должна удерживать большой массив контекста и выдавать связный результат. Окно в 262 144 токена подходит для анализа крупных технических документов, нескольких файлов проекта, длинной переписки, спецификаций и журналов ошибок. Большой контекст не гарантирует безошибочное извлечение каждой детали: на собственной задаче всё равно нужно проверять ссылки, вычисления, ограничения и границы внимания.
Кодовый суббалл 73,8 и результат Code Arena делают модель кандидатом для генерации функций, рефакторинга, объяснения чужого кода, подготовки тестов и разбора ошибок. Рациональный режим работы — давать модели небольшой, проверяемый шаг: сначала описать план изменения, затем предложить патч, после этого прогнать тесты и отдельно проверить пограничные случаи. Для автономного исправления большого репозитория одного рейтинга недостаточно: важны качество tool calling, устойчивость многошагового цикла и поведение конкретного inference-стека.
Официальная документация Moonshot также заявляет мультимодальные входы — текст, изображения и видео — и применение в агентных задачах. Это расширяет сценарии до разбора скриншотов интерфейса, изображений ошибок, документов и видеоматериалов. Но заявленная поддержка формата не равна измеренному качеству на любом типе визуального контента. Если изображение содержит мелкий текст, таблицы или сложную схему, результат следует сверять с оригиналом.
Кому модель подойдёт
- разработчикам, которым нужен сильный кодовый помощник с длинным контекстом;
- командам, анализирующим большие технические документы и репозитории;
- пользователям, которым важна доступность весов для самостоятельного эксперимента;
- создателям прототипов с текстовыми и визуальными входами, готовым проверять стабильность API и инструментов.
Кому стоит искать другой профиль
- тем, кому нужна подтверждённая низкая задержка и предсказуемая скорость — в паспорте таких измерений нет;
- командам, где критична максимальная универсальность, поскольку quality subscore равен 50,0;
- проектам, рассчитывающим на полностью свободную лицензию без дополнительных условий;
- тем, кто принимает решение только по reasoning-функциям: в редакционном паспорте reasoning не отмечен.
Цена и скорость
В зафиксированном паспорте указана цена $0,95 за 1 млн входных токенов и $4,00 за 1 млн выходных токенов. Это разные единицы тарификации: стоимость входа нельзя сравнивать с ценой генерации как с одной общей ставкой. Реальный счёт зависит от длины промпта, объёма ответа, кеширования, наценки посредника, региона и выбранного режима.
Официальная страница API показывает способ подключения Kimi K2.6 через платформу Moonshot, а model card на Hugging Face содержит примеры запуска через Transformers, vLLM и SGLang. Для hosted API и самостоятельного запуска это разные экономические сценарии. В первом случае платят за токены и зависят от условий провайдера; во втором добавляются видеопамять, электричество, инфраструктура, обслуживание и время инженеров.
Скорость в срезе не измерена: значения output tokens per second и time to first token отсутствуют. Нельзя подменять их цифрами из другой версии, другого провайдера, другой квантовки или стороннего стенда. При выборе для интерактивного продукта измеряйте latency самостоятельно на том же регионе, размере контекста, параллелизме и лимитах, которые будут в эксплуатации.
Доступность и лицензия
Паспорт отмечает open weights и лицензию Modified MIT. Это полезно для исследовательских и инженерных команд, которым нужен контроль над развёртыванием, но формулировка «open weights» описывает доступность параметров, а не гарантирует, что весь программный стек, данные, инструменты и условия использования имеют разрешительную лицензию без ограничений.
Перед локальным запуском нужно проверить актуальную model card, текст лицензии, требования к движку и поддержку нужных функций. Model card Kimi K2.6 указывает репозиторий Moonshot на Hugging Face и примеры использования с современными inference-библиотеками. Для production-системы этого всё равно недостаточно без собственного нагрузочного теста, проверки отказоустойчивости и аудита обработки пользовательских данных.
Что говорят официальные материалы
На странице Moonshot Kimi K2.6 представлена как новая модель компании с акцентом на агентные задачи, кодирование и визуальное понимание. В документации API перечислены текстовые, графические и видеовходы, длинное контекстное окно, режимы размышления и обычный режим. Эти сведения относятся к заявлениям и документации разработчика, а не к независимому подтверждению каждого заявленного преимущества.
Найденная model card на Hugging Face подтверждает наличие модели под именем moonshotai/Kimi-K2.6, лицензию Modified MIT и инструкции для Transformers, vLLM и SGLang. Репозиторий Moonshot для семейства Kimi K2 содержит материалы о лицензировании и использовании серии, но не заменяет точную карточку Kimi K2.6. Поэтому архитектурные или аппаратные детали, не нужные для выбора по паспорту, здесь намеренно не расширяются домыслами.
Ограничения
- Средняя уверенность редакционной оценки. Паспорт прямо указывает confidence: средняя, поэтому небольшие различия с соседними позициями не следует воспринимать как устойчивое превосходство.
- Нет Artificial Analysis Intelligence Index. Данных в срезе нет; показатель не восстанавливается по другим источникам.
- Нет измерений скорости. Отсутствуют output tokens per second и time to first token.
- Различаются режимы поставки. Поведение hosted API, локального запуска, квантованных весов и разных серверов может отличаться.
- Мультимодальность требует проверки. Заявленная поддержка входных форматов не гарантирует одинаковое качество на сканах, видео, таблицах или мелком тексте.
- Большой контекст не отменяет верификацию. На длинных входах модель может пропустить важную деталь, неверно связать фрагменты или увеличить стоимость запроса.
- Open weights не равны open source. Modified MIT нужно читать вместе с актуальным текстом лицензии и условиями конкретного использования.
- Тул-чейны сложнее обычного диалога. Инструменты, схемы функций, парсеры и шаблоны сообщений надо тестировать в том же стеке, который будет использоваться в продукте.
Как проверить на своей задаче
- Соберите репрезентативный набор. Возьмите 30–100 реальных запросов: простые, типовые, длинные и аварийные. Для кода добавьте задачи с тестами и известным ожидаемым результатом.
- Зафиксируйте условия. Запишите провайдера, модельный идентификатор, режим, температуру, лимит вывода, длину контекста, регион и версию клиента. Без этого сравнение будет плохо воспроизводимым.
- Разделите качество и стоимость. Считайте отдельно ошибки, успешные тесты, полезность ответа, входные токены, выходные токены и число повторных запросов. Не превращайте цену в показатель точности.
- Проверьте длинный контекст. Используйте документы с контрольными фактами в начале, середине и конце. Просите привести точные цитаты или координаты фрагментов, затем сверяйте ответы программно.
- Проверьте кодовый цикл. Дайте задачу на исправление в тестовом репозитории: анализ, патч, запуск тестов, исправление регрессии. Оцените не только первый ответ, но и способность завершить цикл.
- Проверьте инструменты. Протестируйте корректность JSON-схем, повторный вызов после результата инструмента, ошибки таймаута, пустой ответ и отмену запроса.
- Измерьте задержку. Зафиксируйте time to first token, полное время и tokens per second на нескольких размерах ответа и при разной конкуренции. Эти значения нельзя брать из паспорта — их там нет.
- Сделайте ручную слепую проверку. Перемешайте ответы нескольких конфигураций без названий моделей и оцените полезность по заранее заданной шкале. Это ближе к смыслу human preference, чем субъективное впечатление от одного диалога.
Итоговый вердикт
Kimi K2.6 стоит рассматривать как сильного кандидата для кодирования, длинных входов и сценариев, где важна субъективная полезность ответа. 95,9 по human preference — главный аргумент в её пользу, а 73,8 по coding подтверждает, что модель не ограничивается только приятным стилем общения. Одновременно итоговые 68,6 и 33-е место показывают цену компромисса: quality и efficiency не дают профилю стать равномерно сильным.
Для API-прототипа разумно начать с небольшого набора реальных запросов и учитывать тариф $0,95/$4,00 за миллион входных/выходных токенов как значение конкретного среза, а не вечную цену. Для self-hosting преимущества open weights нужно сопоставить с аппаратными расходами, лицензией и зрелостью нужного inference-стека. Для production-решения обязательны собственные тесты скорости, инструментов, длинного контекста и ошибок.
FAQ
Какое место занимает Kimi K2.6?
В рейтинге COMRAD404 2026 H2 модель занимает 33-е место с COMRAD Score 68,6 из 100. Это редакционная нормализованная оценка, а не процент правильных ответов.
В чём главная сильная сторона модели?
Самый высокий суббалл — human preference, 95,9. Это указывает на сильный результат в пользовательских слепых сравнениях. Coding также выше среднего профиля модели и составляет 73,8.
Подходит ли Kimi K2.6 для программирования?
Да, модель выглядит подходящей для генерации, анализа и рефакторинга кода: coding subscore равен 73,8, а в Code Arena зафиксирован rating 1508,7 и 35-е место. Для автономных изменений репозитория нужны отдельные тесты инструментов и многошагового цикла.
Какова цена Kimi K2.6?
В паспорте указано $0,95 за 1 млн входных токенов и $4,00 за 1 млн выходных токенов. Цена зависит от провайдера и режима, поэтому перед закупкой её нужно перепроверить в актуальном тарифе.
Какая скорость генерации у модели?
В редакционном срезе нет данных ни о output tokens per second, ни о time to first token. Скорость следует измерять на выбранном API или локальном сервере, а не выводить из рейтинга.
Какой контекст поддерживает Kimi K2.6?
Паспорт фиксирует контекст в 262 144 токена. Это технический лимит окна, а не гарантия одинакового качества на всей длине входа.
Является ли модель полностью открытым ПО?
Нет такого вывода делать нельзя. В паспорте указаны open weights и лицензия Modified MIT. Доступность весов не означает, что весь код, данные и условия использования свободны без ограничений.
Источники
- Рейтинг COMRAD404 — место Kimi K2.6 и редакционные показатели выпуска 2026 H2.
- Официальная страница Kimi K2.6 — материалы Moonshot о модели и её назначении.
- Документация Kimi API: Kimi K2.6 — заявленные режимы, форматы входа, контекст и пример подключения.
- Model card Kimi K2.6 на Hugging Face — имя модели, лицензия и инструкции запуска.
- Репозиторий MoonshotAI/Kimi-K2 — материалы разработчика о серии Kimi K2, использовании и Modified MIT.
- LMArena Text Leaderboard — текстовый рейтинг и попарные пользовательские сравнения.
- LMArena Leaderboard — данные Code Arena, использованные в кодовом суббалле.
Срез фактов и рейтингов: 31 августа 2026 года. Официальные заявления разработчика, независимые измерения и редакционные оценки в статье разделены.
