Запись архива

Hunyuan hy3 Preview: сильна по предпочтениям, слаба в коде

Hunyuan hy3 Preview занимает 84-е место с COMRAD Score 61,3. Модель выделяется пользовательскими предпочтениями, эффективностью и контекстом 262 144 токена, но уступает по качеству и особенно по коду. Preview-статус и лицензия требуют осторожности.

Профиль Hunyuan hy3 Preview с COMRAD Score 61,3, пятью суббаллами, ценой API и контекстом 262 144 токена

Hunyuan hy3 Preview стоит рассматривать как доступную по API модель для диалоговых, редакционных и контекстных задач, но не как готовую основу критичного программного агента. Ее профиль необычно неравномерен: высокая оценка человеческих предпочтений сочетается со средним качеством и низким кодовым суббаллом. Открытые веса расширяют варианты развертывания, однако масштаб модели и условия Tencent Hy Community License заметно ограничивают практическую свободу.

Коротко

  • Место: 84-е в редакции рейтинга COMRAD404 2026 H2.
  • COMRAD Score: 61,3 из 100 — это нормализованная редакционная оценка, а не процент правильных ответов.
  • Главная сильная сторона: human preference — 82,8, подтвержденная заметным массивом слепых пользовательских сравнений.
  • Главная слабость: coding — 35,1; модель нельзя выбирать для разработки только по заявлениям Tencent о собственных тестах.
  • Цена в срезе: $0,29 за миллион входных и $1,17 за миллион выходных токенов.
  • Контекст: 262 144 токена.
  • Статус: preview. Это не основание считать модель production-ready.
  • Веса: опубликованы, но распространяются по ограничительной community-лицензии, а не как открытое ПО без территориальных и пользовательских условий.

Паспорт модели

Параметр Значение на 31 августа 2026 года
Разработчик Tencent
Место в COMRAD404 84
COMRAD Score 61,3 / 100
Уверенность профиля Средняя
LMArena Text 1413,0; место 130; 6611 голосов
LMArena Code 1356,2; место 89
Artificial Analysis Intelligence Index Данных в срезе нет
Цена входа / выхода $0,29 / $1,17 за 1 млн токенов
Скорость и TTFT Данных в срезе нет
Контекст 262 144 токена
Веса и лицензия Open weights; Tencent Hy Community License
Статус Preview

Архитектурные характеристики не участвовали в расчете рейтинга. В официальной карточке Tencent описывает Hy3 preview как MoE-модель с 295 млрд параметров, из которых 21 млрд активируются при обработке токена; отдельно указаны 3,8 млрд параметров MTP-слоя. Это заявление разработчика, а не независимое измерение производительности.

Место в рейтинге

84-е место означает, что Hunyuan hy3 Preview не относится к универсальным лидерам среза, хотя отдельные свойства модели выглядят существенно лучше итоговой позиции. Полную таблицу и правила чтения результатов можно посмотреть в рейтинге ИИ-моделей COMRAD404. Профиль рассчитан по методологии 1.0 для редакции 2026 H2.

Итог формируют пять нормализованных суббаллов с разными весами. Качество дает 40% оценки, предпочтения пользователей — 30%, код — 15%, эффективность — 10%, доступность — 5%. Поэтому высокий human preference не может полностью компенсировать результат по качеству и коду. Вклад компонентов после округления составляет 20,00 + 24,84 + 5,27 + 8,03 + 3,15, что и дает COMRAD Score около 61,3.

LMArena rating также нельзя читать как процент качества. Значение 1413,0 — статистический рейтинг, полученный из слепых попарных сравнений ответов. 6611 голосов делают сигнал полезным, но не превращают его в гарантию результата на русском языке, в конкретной отрасли или при длинном системном промпте.

Разбор пяти суббаллов

Суббалл Оценка Вес Практический смысл
Quality 50,0 40% Средняя доказательная база общего качества; Intelligence Index отсутствует
Human preference 82,8 30% Ответы часто нравятся пользователям в слепом сравнении
Coding 35,1 15% Слабое место профиля, требующее отдельного теста на репозитории
Efficiency 80,3 10% Выгодное соотношение зафиксированной API-цены и доступного контекста
Access 62,9 5% Веса доступны, но лицензия и инфраструктурные требования ограничивают внедрение

Quality 50,0 следует трактовать особенно осторожно. В срезе нет Artificial Analysis Intelligence Index, и редакция не восстанавливает его по памяти или заявлениям производителя. Средняя уверенность профиля прямо указывает, что данных достаточно для предварительного выбора, но недостаточно для окончательного решения без пилота.

Human preference 82,8 — наиболее убедительная сторона модели. Она указывает не на фактическую безошибочность, а на то, что стиль, полезность и воспринимаемое качество ответов часто выигрывали симпатию участников Arena. Для чат-интерфейса это важный сигнал; для юридической проверки, программирования или точного извлечения фактов — только один из сигналов.

Coding 35,1 конфликтует с акцентом официальной карточки на coding и agent tasks. Противоречия здесь нет: Tencent сообщает результаты выбранных разработчиком тестов, тогда как COMRAD404 учитывает внешний рейтинговый профиль. Для выбора важнее воспроизводимость именно вашего рабочего сценария.

Что официально известно

Tencent опубликовала веса Hy3 preview 23 апреля 2026 года. Официальные материалы называют ее instruct-моделью с архитектурой Mixture-of-Experts, контекстом 256K и поддержкой BF16. В репозитории приведены команды запуска через vLLM и SGLang, OpenAI-совместимый интерфейс, настройка вызова инструментов, а также материалы для полного и LoRA-дообучения.

Разработчик заявляет улучшения в сложных рассуждениях, следовании инструкциям, обучении из контекста, программировании и агентных задачах. Эти формулировки полезны как описание замысла модели, но не заменяют независимые измерения. Публикуемые Tencent таблицы смешивают результаты base- и instruct-вариантов, поэтому переносить любой показатель из них на конкретную API-конфигурацию без проверки нельзя.

Есть и классификационный нюанс. В переданном паспорте поле reasoning имеет значение false, тогда как официальная документация описывает параметр reasoning_effort со значениями no_think, low и high. Редакционный паспорт не переопределяется задним числом: для рейтинга модель считается не имеющей подтвержденного reasoning-флага, а наличие и поведение режимов следует проверять у выбранного провайдера или в собственной установке.

Возможности и сценарии

Лучший стартовый сценарий для Hunyuan hy3 Preview — задачи, где важны удобочитаемый ответ, обработка объемного контекста и умеренная стоимость, а результат можно проверить человеком или программным валидатором.

  • Диалоговые интерфейсы. Высокий human preference делает модель кандидатом для поддержки, внутренних ассистентов и черновых консультационных систем. До запуска нужно проверить тон, отказы и фактическую точность на языке аудитории.
  • Редакционная обработка. Суммаризация документов, классификация обращений, преобразование заметок в структуру и подготовка вариантов текста хорошо соответствуют профилю, если исходные факты остаются доступными редактору.
  • Работа с длинными материалами. Контекст 262 144 токена позволяет передавать крупные подборки документов, журналы событий или части репозитория. Номинальная вместимость не гарантирует одинакового внимания ко всем фрагментам.
  • Извлечение данных. Модель можно тестировать для заполнения JSON, таблиц и карточек из документов, обязательно добавляя проверку схемы и сверку цитат с источником.
  • Инструментальные прототипы. Официальный серверный пример поддерживает tool calling. Однако preview-статус требует ограничений прав, тайм-аутов, журналирования и подтверждения опасных действий.
  • Черновая помощь разработчику. Объяснение небольших фрагментов и генерация тестовых заготовок допустимы как вспомогательная функция. Автономное изменение production-репозитория не соответствует слабому кодовому суббаллу без дополнительной оценки.

Цена и скорость

В зафиксированном срезе вход стоит $0,29 за миллион токенов, выход — $1,17 за миллион токенов. Выход примерно в четыре раза дороже входа, поэтому длина ответа влияет на бюджет сильнее, чем большой входной документ.

Например, запрос со 100 тысячами входных и 20 тысячами выходных токенов по этим ставкам обойдется примерно в $0,0524: $0,029 за вход и $0,0234 за выход. Это расчет по паспортным значениям, а не коммерческое предложение. Реальный счет может включать округление, кэширование, минимальные платежи, разные режимы и наценку API-провайдера.

Данных об output tokens per second и time to first token в срезе нет. Следовательно, по паспорту нельзя обещать ни быстрый первый ответ, ни определенную пропускную способность. Цена и скорость зависят от провайдера, аппаратной платформы, длины контекста, батчинга, режима рассуждения и параметров генерации. Их нужно измерять одновременно на одинаковой нагрузке.

Контекст и развертывание

Контекст в паспорте равен 262 144 токенам, что соответствует официальному обозначению 256K. Он полезен для поиска связей между несколькими документами, но использовать все окно по умолчанию невыгодно: растут стоимость входа, задержка и риск того, что значимый фрагмент потеряется среди нерелевантного текста.

Практичная схема — сначала отбирать фрагменты поиском или правилами, затем передавать модели компактный пакет с идентификаторами источников. Для проверки длинного контекста подготовьте факты в начале, середине и конце документа и оцените не только полноту ответа, но и точность привязки к каждому фрагменту.

Самостоятельное размещение возможно благодаря опубликованным весам. Однако это крупная модель: Tencent указывает 295 млрд общих и 21 млрд активных параметров и рекомендует для обслуживания конфигурацию из восьми H20-3e либо других GPU с большим объемом памяти. Это рекомендация разработчика для его сценария, а не универсальный минимум. Стоимость инфраструктуры, совместимость версий, квантование и требуемая параллельность должны оцениваться отдельно.

Ограничения

  • Preview-статус. Поведение, интерфейсы, доступность и условия обслуживания могут измениться. Модель не следует называть production-ready без собственного процесса приемки.
  • Неполный независимый профиль. Artificial Analysis Intelligence Index отсутствует; нет независимых паспортных данных о скорости и времени до первого токена.
  • Слабая кодовая оценка. Coding 35,1 делает рискованными автономные исправления, миграции и действия агента без тестов и ревью.
  • Неравномерность метрик. Нравящийся пользователю ответ может быть убедительным, но фактически неверным. Высокий human preference не компенсирует необходимость проверки.
  • Большой вес развертывания. Open weights не означают легальный запуск на одной обычной видеокарте или дешевую эксплуатацию.
  • Ограничительная лицензия. Tencent Hy Community License исключает из своей территории Европейский союз, Великобританию и Южную Корею, содержит правила распространения и использования, а для организаций свыше установленного порога аудитории предусматривает отдельное лицензирование.
  • Ограничение на обучение других моделей. Текст лицензии запрещает использовать модель, ее выводы или результаты для улучшения иной ИИ-модели, кроме Tencent Hy и производных от нее.

Поэтому open weights здесь означает доступ к весам, но не открытое программное обеспечение в привычном смысле. Перед коммерческим внедрением необходимо проверить территорию использования, цепочку распространения, раскрытие фактического поставщика сервиса и применимость acceptable use policy. Эта статья не заменяет юридическое заключение.

Кому модель подходит

Hunyuan hy3 Preview входит в шорт-лист, если команде нужен недорогой API для обработки больших текстовых пакетов, важна возможность самостоятельного размещения и допускается обязательная проверка результата. Она также интересна исследовательским группам, которым нужен крупный MoE-чекпойнт для экспериментов в разрешенной лицензией территории.

Модель хуже соответствует проекту, где требуются предсказуемый SLA, подтвержденная скорость, свободная международная дистрибуция или автономное программирование без ревью. Для таких задач недостаточно ни официальных заявлений Tencent, ни высокого Arena-предпочтения.

Как проверить на своей задаче

  1. Зафиксируйте версию. Запишите точный идентификатор модели, API-провайдера, дату, endpoint, режим, температуру, top_p и лимит ответа.
  2. Соберите 50–200 реальных примеров. Включите обычные запросы, редкие случаи, плохие исходные данные, попытки нарушения инструкции и длинные контексты.
  3. Определите проверяемый результат. Для извлечения используйте точность полей и валидность JSON; для текста — рубрику редактора; для кода — тесты, линтер, статический анализ и ревью.
  4. Разделите режимы. Если провайдер поддерживает reasoning_effort, отдельно измерьте no_think и более глубокий режим. Не смешивайте их цену и задержку.
  5. Проверьте длинный контекст. Разместите контрольные факты в разных частях документа, добавьте похожие отвлекающие фрагменты и потребуйте ссылки на идентификаторы источников.
  6. Измерьте эксплуатацию. Запишите медиану и 95-й перцентиль TTFT, скорость вывода, долю ошибок API, стоимость успешного результата и максимальную устойчивую параллельность.
  7. Проведите слепое сравнение. Скройте название модели от оценщиков, перемешайте ответы и заранее зафиксируйте критерии победы.
  8. Сделайте юридический чек. До размещения весов или публичного сервиса проверьте лицензию, территорию, условия дистрибуции и допустимые способы использования вывода.

Решение о внедрении лучше принимать по стоимости одного принятого результата, а не одного миллиона токенов. Дешевая генерация становится дорогой, если ее часто приходится переделывать или проверять вручную.

FAQ

Hunyuan hy3 Preview — это reasoning-модель?

В паспорте COMRAD404 флаг reasoning равен false. При этом официальная документация описывает параметр reasoning_effort. Поэтому наличие и качество соответствующего режима нужно проверять в конкретном API или собственной установке, не меняя задним числом классификацию рейтинга.

Можно ли считать модель открытым ПО?

Нет. Веса опубликованы, но Tencent Hy Community License содержит территориальные, коммерческие и пользовательские ограничения. Корректное обозначение — open weights по community-лицензии.

Подходит ли модель для программирования?

Для черновых объяснений и локальных заготовок — возможно. Для автономной работы с репозиторием профиль слабый: кодовый суббалл равен 35,1, поэтому обязательны тесты, песочница и человеческое ревью.

Насколько надежен рейтинг LMArena 1413?

Он основан на слепых попарных сравнениях и в срезе сопровождается 6611 голосами. Это содержательный сигнал пользовательского предпочтения, но не процент правильных ответов и не гарантия точности в вашей предметной области.

Сколько стоит использование Hunyuan hy3 Preview?

В паспортном срезе указано $0,29 за миллион входных и $1,17 за миллион выходных токенов. Тариф зависит от API-провайдера и режима и может измениться.

Известна ли скорость модели?

Нет. В срезе отсутствуют и скорость вывода, и time to first token. Эти показатели необходимо измерить у выбранного провайдера на своей длине контекста и параллельной нагрузке.

Можно ли сразу внедрять ее в production?

Preview-статус не позволяет автоматически считать модель production-ready. Нужны приемочные тесты, мониторинг, резервный маршрут, контроль версий и проверка лицензии.

Источники