hy3 — это модель Tencent с необычно неравномерным, но практически полезным профилем. В рейтинге COMRAD404 она заняла 26-е место с COMRAD Score 72,0. Главные опоры результата — высокий балл человеческих предпочтений 94,5, эффективность 90,8 и кодовый суббалл 74,8. При этом редакционная оценка качества составляет только 50,0, а независимый текстовый рейтинг LMArena заметно скромнее кодового. Поэтому hy3 разумно рассматривать не как универсального победителя всех задач, а как доступную модель с хорошим балансом для прикладного использования, разработки и длинного контекста.
Ниже приведён разбор по срезу рейтинга от 31 августа 2026 года. COMRAD Score и пять суббаллов — нормализованные редакционные оценки от 0 до 100, а не проценты правильных ответов. Цена, контекст и показатели LMArena имеют собственные единицы и не складываются в единую шкалу качества.
Коротко
- Итоговая позиция: 26-е место в редакции COMRAD404 2026 H2.
- COMRAD Score: 72,0 из 100.
- Лучшие стороны профиля: человеческие предпочтения — 94,5; эффективность — 90,8; код — 74,8.
- Слабое место по паспорту: качество — 50,0; отдельный Artificial Analysis Intelligence Index в срезе отсутствует.
- Открытость: веса доступны, лицензия указана как Apache 2.0.
- Контекст: 262 144 токена в паспорте рейтинга.
- Цена: 0,132 доллара за миллион входных токенов и 0,528 доллара за миллион выходных токенов в зафиксированном режиме.
- Скорость: значения output tokens per second и time to first token в паспорте отсутствуют.
Итоговый выбор зависит от того, что важнее: низкая стоимость, длинные документы и программирование или максимально предсказуемое качество на широком наборе задач. Для первого набора требований hy3 выглядит убедительно. Для второго одного места в рейтинге недостаточно — модель стоит проверять на собственных данных.
Паспорт модели
| Параметр | Значение |
|---|---|
| Модель | hy3 |
| Разработчик | Tencent |
| Место в COMRAD404 2026 H2 | 26 |
| COMRAD Score | 72,0 из 100 |
| Лицензия | Apache 2.0 |
| Open weights | Да |
| Reasoning | Нет в паспорте |
| Preview | Нет |
| Контекст | 262 144 токена |
| LMArena Text | 1455,6; 59-е место; 6466 голосов |
| LMArena Code | 1512,6; 33-е место |
| Artificial Analysis Intelligence Index | Данных в срезе нет |
Официальная карточка Tencent на Hugging Face описывает hy3 как MoE-модель с 295 млрд общих параметров и 21 млрд активных параметров. В карточке также указаны 3,8 млрд параметров MTP-слоя, 192 эксперта с активацией top-8 и контекст до 256K. В рейтинговом паспорте контекст записан точнее — 262 144 токена; для редакционного сравнения используется именно значение паспорта. Официальные данные о внутреннем устройстве полезны для понимания эффективности, но не заменяют измерения стоимости и задержки у конкретного API-провайдера.
Место в рейтинге
26-я позиция означает, что hy3 попала в верхнюю часть рассматриваемого списка, но не относится к моделям, которые автоматически следует выбирать для любого запроса. COMRAD Score 72,0 рассчитан с весами: качество — 40%, человеческие предпочтения — 30%, код — 15%, эффективность — 10%, доступность — 5%. Такой баланс объясняет, почему высокий показатель пользовательских сравнений заметно поддерживает общий результат, а умеренный балл качества не обрушает его.
Важно не читать COMRAD Score как вероятность успешного ответа. Это редакционная нормализация нескольких измерений на шкале 0–100. Например, 94,5 в human_preference не означает, что 94,5% ответов hy3 лучше ответов соперников. Это высокий суббалл в соответствующей категории рейтинга.
В LMArena текстовый рейтинг hy3 составил 1455,6, что соответствует 59-му месту и основано на 6466 голосах. Кодовый рейтинг — 1512,6 и 33-е место. LMArena использует статистику слепых попарных сравнений пользовательских ответов, поэтому эти числа являются рейтингом предпочтений, а не процентом правильных решений. Разрыв между текстовой и кодовой позициями подсказывает, что в практических задачах разработки hy3 может выглядеть сильнее, чем в усреднённом текстовом диалоге.
Пять суббаллов
| Суббалл | Оценка | Что это означает в профиле |
|---|---|---|
| Качество | 50,0 | Средняя редакционная опора общего результата; нельзя считать hy3 безусловно сильной на всех типах задач. |
| Human preference | 94,5 | Очень сильный сигнал пользовательских слепых сравнений в используемом наборе данных. |
| Coding | 74,8 | Хорошая позиция для программирования; кодовый LMArena-рейтинг выше текстового по месту. |
| Efficiency | 90,8 | Сильная сторона, связанная с сочетанием стоимости, доступности и вычислительной практичности в методике. |
| Access | 67,9 | Доступность заметно поддерживает модель, но не является максимальной среди всех участников. |
Профиль получается асимметричным. Его нельзя пересказать фразой «модель среднего качества». Точнее сказать так: редакционная оценка качества умеренная, но модель получает большую поддержку за пользовательское восприятие, эффективность и программирование. Для прикладного выбора это означает необходимость разделять типы нагрузки: чат, генерация кода, анализ репозитория, длинные документы и агентные действия могут давать разные результаты.
Возможности и сценарии
Официальные материалы Tencent позиционируют Hy3 как гибридную модель с быстрым и медленным режимами мышления, агентными возможностями и интеграцией в продукты компании. Однако в переданном паспорте поле reasoning имеет значение false. Поэтому в статье не следует считать наличие отдельного reasoning-режима подтверждённым свойством рейтингового профиля. Если провайдер предлагает переключатели thinking, reasoning или extended reasoning, их нужно проверять по документации именно этого API.
Программирование
Кодовый суббалл 74,8 и 33-е место в LMArena Code делают hy3 кандидатом для генерации функций, рефакторинга, написания тестов и объяснения ошибок. Особенно уместны задачи, где модель получает явные ограничения: используемый язык, версию библиотек, формат патча, команды проверки и критерии готовности. Длинный контекст полезен при передаче нескольких файлов, но сам по себе не гарантирует, что модель найдёт нужную зависимость или сохранит архитектурные инварианты.
Работа с длинными материалами
Контекст 262 144 токена позволяет проектировать сценарии с большими спецификациями, журналами, наборами документов и кодовыми базами. На практике размер окна — лишь верхняя граница. Нужно отдельно проверять качество извлечения фактов из начала, середины и конца документа, устойчивость ссылок между разделами и поведение при конфликтующих требованиях.
Офисные и прикладные задачи
Модель можно тестировать для подготовки черновиков, преобразования структурированных данных, классификации обращений, составления SQL-запросов и создания инструкций. Для производственного процесса лучше ограничивать формат ответа схемой, добавлять автоматическую валидацию и не разрешать модели самостоятельно считать результат принятой без проверки. Высокий human_preference не отменяет риска фактических ошибок.
Агентные сценарии
Tencent сообщает об использовании Hy3 в продуктах и сервисах компании, а официальные материалы упоминают инструментальное применение. Но конкретная безопасность агентных действий зависит не только от модели: важны права инструментов, песочница, журналирование, подтверждение опасных операций и лимиты бюджета. Для первого запуска следует разрешать чтение и подготовку изменений, но оставлять публикацию, удаление и финансовые действия за человеком.
Цена и скорость
В паспорте зафиксирована цена 0,132 доллара за миллион входных токенов и 0,528 доллара за миллион выходных токенов. Это разные тарифные единицы: нельзя складывать их или сравнивать только одну из них с общей стоимостью другого API. Итоговый счёт зависит от соотношения длины промптов и ответов, кэширования, округления токенов, пакетной обработки и политики провайдера.
Пример расчёта для ориентира: запрос на 100 000 входных токенов и ответ на 10 000 выходных токенов при этих ставках стоил бы 0,0132 + 0,00528 = 0,01848 доллара. Это арифметическая иллюстрация по данным паспорта, а не обещание действующего тарифа. Перед подключением нужно сверить страницу конкретного API: цена может различаться по региону, режиму, версии, квотам и дате.
Показатели output tokens per second и time to first token в срезе отсутствуют. Следовательно, нельзя честно утверждать, что hy3 «быстрая», даже если MoE-архитектура и небольшое число активных параметров дают основания ожидать вычислительную эффективность. Для пользователя важнее измерить задержку до первого токена и устойчивую скорость полного ответа в выбранном сервисе.
Открытые веса и лицензия
В паспорте указано, что у hy3 есть open weights, а лицензия — Apache 2.0. Это делает модель удобной для самостоятельного развёртывания, адаптации инфраструктуры и контроля над маршрутом данных. Но открытые веса не равны автоматически открытому программному обеспечению: нужно отдельно смотреть условия лицензии на веса, код инференса, производные работы и используемые компоненты.
Официальная карточка показывает запуск через Transformers и варианты развёртывания через vLLM и SGLang. При этом публикация весов крупной MoE-модели не означает, что локальный запуск будет простым или дешёвым. Потребуются подходящее аппаратное обеспечение, память под веса и KV-кэш, совместимые версии библиотек и время на настройку. Для части команд API окажется рациональнее локальной инфраструктуры.
Ограничения
- Нет Intelligence Index: Artificial Analysis Intelligence Index в переданном срезе отсутствует. Нельзя восстанавливать его по другим рейтингам или делать вид, что показатель известен.
- Нет данных о скорости: отсутствуют и скорость генерации, и time to first token. Сравнение по latency требует собственного замера.
- Средний quality-суббалл: 50,0 показывает, что высокая итоговая позиция не означает равномерно высокое качество во всех категориях.
- Зависимость от режима: доступные параметры, tool calling, длина ответа и reasoning-переключатели могут различаться у провайдеров.
- Большой контекст не гарантирует понимание: модель может пропускать факты, путать версии и неправильно разрешать противоречия в длинном вводе.
- Агентные риски: вызовы инструментов требуют ограничений прав, трассировки и ручного подтверждения необратимых операций.
- Лицензионная проверка: перед коммерческим распространением нужно прочитать актуальный текст Apache 2.0 и условия используемого окружения.
Отдельно следует различать официальные заявления Tencent и независимые измерения. Tencent описывает архитектуру, сценарии внедрения и заявленные свойства модели. LMArena даёт статистический результат слепых сравнений. COMRAD404 интерпретирует набор показателей через собственную систему весов. Ни один из этих источников не заменяет тестирование на конкретном наборе запросов.
Кому стоит выбрать hy3
hy3 подходит командам, которым нужна модель с открытыми весами, большим контекстом и умеренной стоимостью API. Наиболее логичные кандидаты — разработчики внутренних ассистентов, команды автоматизации документации, сервисы обработки длинных входов и проекты, где кодовая генерация важнее литературной универсальности.
Модель особенно интересна, если бюджет ограничен, но требуется работать не только с короткими вопросами. Низкая цена входных токенов делает привлекательными сценарии с большими инструкциями или повторной передачей контекста, хотя реальную экономику нужно считать с учётом выходных токенов и кэширования.
С осторожностью следует выбирать hy3 для систем, где ошибка имеет высокую цену: юридические выводы без проверки, медицинские рекомендации, финансовые решения, автоматическое изменение инфраструктуры и публикация материалов без редактора. В таких задачах сильный рейтинг предпочтений — полезный сигнал удобства, но не доказательство фактической надёжности.
Как проверить на своей задаче
- Соберите реальный набор. Возьмите 50–200 обезличенных запросов из будущего процесса: простых, типичных и сложных. Не ограничивайтесь примерами из презентации разработчика.
- Разделите задачи по типам. Отдельно отметьте чат, извлечение данных, код, длинный контекст, структурированный вывод и вызов инструментов.
- Заранее определите критерии. Для кода это прохождение тестов и отсутствие регрессий; для извлечения — точность полей; для текста — полнота, стиль и фактологическая проверяемость.
- Проверьте контекст. Разложите контрольные факты в начале, середине и конце длинного документа. Добавьте конфликтующие инструкции и ссылки на конкретные разделы.
- Измерьте стоимость. Запишите входные и выходные токены, повторные запросы, ошибки, ретраи и кэширование. Считайте итог за одну бизнес-операцию, а не только тариф за миллион токенов.
- Измерьте задержку. Зафиксируйте время до первого токена, время полного ответа и разброс на одинаковых запросах. Повторите тест в часы обычной нагрузки.
- Проверьте устойчивость. Запустите каждый важный запрос несколько раз с одинаковыми параметрами и сравните не лучший, а типичный результат.
- Ограничьте инструменты. На агентном тесте выдайте минимальные права, включите журнал и потребуйте подтверждение перед изменением данных.
- Сравните с текущим решением. В паспорте нет чисел других моделей, поэтому редакционный рейтинг не заменяет контрольную группу внутри вашей системы.
Хороший итог пилота — не субъективное впечатление, а таблица с качеством, долей ручных исправлений, стоимостью, задержкой и количеством опасных сбоев. Если hy3 выигрывает по общей стоимости владения и проходит порог качества, её 26-е место становится практически значимым именно для вашей команды.
FAQ
Что означает 26-е место hy3?
Это позиция модели в редакции COMRAD404 2026 H2 по срезу на 31 августа 2026 года. Место рассчитано из нормализованного COMRAD Score и не является процентом правильных ответов.
Можно ли считать 94,5 балла human preference точностью 94,5%?
Нет. Это суббалл от 0 до 100 в редакционной методике. Он отражает силу модели в категории пользовательских предпочтений, но не сообщает долю верных ответов.
Есть ли у hy3 отдельный режим reasoning?
В переданном паспорте поле reasoning указано как false. Официальные материалы Tencent описывают гибридные механизмы мышления, но конкретный режим и его доступность нужно проверять у выбранного провайдера.
Сколько стоит использование hy3?
В паспорте указаны 0,132 доллара за миллион входных токенов и 0,528 доллара за миллион выходных токенов. Это значения зафиксированного режима, а не гарантия неизменного тарифа для всех API.
Известна ли скорость генерации?
Нет. В срезе отсутствуют и output tokens per second, и time to first token. Скорость следует замерить самостоятельно у конкретного сервиса и в выбранном режиме.
Подходит ли hy3 для локального запуска?
Официальная карточка публикует веса и инструкции для Transformers, vLLM и SGLang, а в паспорте указаны open weights и лицензия Apache 2.0. Но модель крупная, поэтому требования к памяти, GPU и конфигурации нужно оценивать отдельно.
Можно ли использовать hy3 в коммерческом продукте?
Паспорт указывает Apache 2.0, однако перед коммерческим запуском необходимо проверить актуальную лицензию, условия конкретного провайдера и ограничения всех компонентов инфраструктуры.
Источники
Редакционный рейтинг: рейтинг ИИ-моделей COMRAD404, редакция 2026 H2, методология 1.0, срез 31 августа 2026 года.
- Страница модели hy3 на Hugging Face — официальная карточка, лицензия, архитектура MoE, параметры, контекст и инструкции запуска.
- Официальный релиз Tencent о выпуске Hy3 — дата официального запуска, заявленные сценарии интеграции и описание модели разработчиком.
- Репозиторий Tencent-Hunyuan/Hy3 — официальный репозиторий, связанный с моделью и её экосистемой.
- LMArena Text Leaderboard — текстовый рейтинг, место и статистика пользовательских сравнений.
- LMArena Leaderboard — данные Code Arena, использованные в кодовом суббалле.
- Artificial Analysis LLM Leaderboard — источник для Intelligence Index, цен, скорости, контекста и API-функций; показатель hy3 в переданном срезе не зафиксирован.
Официальные материалы разработчика использованы для описания опубликованных свойств и способов запуска. Рейтинги LMArena и оценки COMRAD404 трактуются отдельно; там, где метрика отсутствует в паспорте, она не восстанавливалась по внешним данным.
