Коротко
Nvidia Nemotron 3 Ultra 550B A55B NVFP4 стоит рассматривать прежде всего как управляемую reasoning-модель для длинных документов, агентных процессов и собственного развертывания, а не как безусловный выбор для программирования. Ее главные аргументы — открытые веса, высокий суббалл доступности 96,3, сильная пользовательская оценка и контекст 512 288 токенов в зафиксированном измерении. Главный повод для осторожности — суббалл coding 34,6 и отсутствие отдельной метрики LMArena Code.
В редакционном рейтинге COMRAD404 модель занимает 35-е место с COMRAD Score 66,9. Это нормализованная оценка по шкале 0–100, а не процент правильных ответов. Профиль модели заметно лучше среднего выглядит по человеческим предпочтениям, эффективности и доступу, но итог ограничивают сравнительно умеренный quality и слабый coding.
Практический вывод: Nemotron 3 Ultra NVFP4 интересен командам, которым нужны контролируемый режим рассуждения, большой рабочий контекст и возможность разместить веса в собственной инфраструктуре. Если же основная нагрузка — автоматическое исправление репозиториев или генерация кода без проверки человеком, решение нужно сначала прогнать на закрытом наборе реальных задач.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Разработчик | Nvidia |
| Версия | Nemotron 3 Ultra 550B A55B NVFP4 |
| Место COMRAD404 | 35 |
| COMRAD Score | 66,9 из 100 |
| Лицензия | OpenMDW-1.1 |
| Доступность весов | Да |
| Режим рассуждения | Да |
| Preview | Нет |
| Контекст в измерении | 512 288 токенов |
| Уверенность редакции | Средняя |
| Срез данных | 31 августа 2026 года |
Обозначение 550B A55B описывает разреженную модель: официальные материалы Nvidia указывают 550 млрд параметров суммарно и около 55 млрд активных параметров на токен. NVFP4 — вариант весов с низкой точностью, ориентированный на уменьшение аппаратного следа и эффективный инференс. Это отдельный постобученный чекпойнт, а не базовая BF16-модель без инструктивного дообучения.
Место в рейтинге
35-е место отражает не провал по одной метрике, а несбалансированность характеристик. В методологии 1.0 качество получает вес 40%, человеческие предпочтения — 30%, программирование — 15%, эффективность — 10%, доступ — 5%. Поэтому высокий результат в LMArena Text и открытые веса не могут полностью компенсировать quality 59,1 и coding 34,6.
Artificial Analysis Intelligence Index равен 38,3. Это самостоятельный индекс независимого бенчмарка, а не доля правильных ответов и не COMRAD Score. В LMArena Text модель получила rating 1426,2, 102-е место и 10 688 голосов. Rating здесь является статистической величиной, полученной из слепых попарных сравнений ответов. Его нельзя читать как «1426 баллов качества» или процент успешных решений.
Итоговая позиция выглядит логичной для модели, которая убедительнее проявляет себя в пользовательском взаимодействии и инфраструктурной доступности, чем в агрегированной интеллектуальной оценке и кодинге. Полную таблицу и соседние позиции следует смотреть в рейтинге ИИ-моделей COMRAD404 за редакцию 2026 H2.
Что показывают пять суббаллов
| Суббалл | Оценка | Редакционная интерпретация |
|---|---|---|
| Quality | 59,1 | Умеренный общий результат: модель требует проверки фактов и сложных выводов. |
| Human preference | 86,4 | Сильная сторона: ответы часто предпочитают в слепом сравнении. |
| Coding | 34,6 | Слабое место профиля; отдельного LMArena Code rating в срезе нет. |
| Efficiency | 73,8 | Хорошее сочетание зафиксированной цены, скорости и рабочего контекста. |
| Access | 96,3 | Почти максимальная редакционная оценка благодаря доступным весам и вариантам развертывания. |
Эти значения нормализованы редакцией по шкале 0–100 и не являются процентами качества. Например, human preference 86,4 не означает, что модель выигрывает ровно 86,4% диалогов, а coding 34,6 не означает 34,6% решенных задач. Суббаллы нужны для сопоставления разных типов сигналов внутри единой методологии.
Самое важное расхождение — между human preference 86,4 и quality 59,1. Модель может создавать связные, удобные и субъективно привлекательные ответы, не демонстрируя столь же высокого результата в агрегате независимых интеллектуальных тестов. Для бизнеса это означает, что хорошее первое впечатление нельзя использовать вместо приемочного теста на точность.
Архитектура и конкретная версия
По официальной карточке семейства и техническому отчету, Nemotron 3 Ultra использует гибрид Mamba-2, attention и Latent Mixture-of-Experts, дополненный Multi-Token Prediction. Разреженная маршрутизация активирует только часть общей емкости модели для каждого токена. Mamba-слои должны уменьшать стоимость обработки длинных последовательностей, а MTP может использоваться для ускорения генерации через спекулятивное декодирование.
Важно не смешивать варианты. В этой статье рассматривается постобученный NVFP4-чекпойнт. Base BF16 предназначен прежде всего для дальнейшего обучения и настройки, а постобученный BF16 является более высокоточным вариантом семейства с иным аппаратным следом. Результаты одного чекпойнта нельзя автоматически переносить на другой.
Официальные материалы заявляют поддержку контекста до одного миллиона токенов при соответствующей конфигурации сервера. Однако паспорт рейтинга фиксирует 512 288 токенов. Для выбора API и расчета нагрузки следует опираться именно на лимит конкретного провайдера, а не только на теоретический максимум модели.
Возможности и сценарии
Длинные документы и RAG
Контекст в 512 288 токенов позволяет помещать в запрос большие подборки документов, историю агента, фрагменты репозитория или результаты поиска. Это не гарантирует равномерного внимания ко всему входу: качество извлечения нужно измерять отдельно в начале, середине и конце контекста. Практически модель подходит для многошагового анализа договоров, технической документации, отчетов и внутренних баз знаний, если ответы снабжаются ссылками на исходные фрагменты.
Агенты и работа с инструментами
Nvidia позиционирует Ultra для длительных агентных процессов, вызова инструментов и сложных цепочек действий. Наличие reasoning-режима делает ее интересной для задач, где полезно выделить больше вычислений на планирование. Но надежность агента зависит не только от модели: необходимы строгие схемы инструментов, лимиты шагов, тайм-ауты, журналирование и проверка критических действий.
Диалоговые и аналитические интерфейсы
Human preference 86,4 указывает, что сильной зоной могут быть ассистенты, исследовательские интерфейсы, разбор неоднозначных запросов и подготовка структурированных ответов. Здесь полезно тестировать не только фактическую точность, но и соблюдение формата, умение задавать уточняющие вопросы, устойчивость к противоречивым инструкциям и сохранение контекста в длинной беседе.
Программирование
Официальная карточка включает код среди целевых областей, но редакционный coding 34,6 требует консервативной трактовки. Модель можно пробовать для объяснения кода, составления плана миграции, поиска потенциальных ошибок и генерации тестов. Для автономного внесения изменений нужны запуск тестов в песочнице, статический анализ и обязательное ревью. LMArena Code rating и место в кодовом рейтинге в срезе отсутствуют, поэтому подтверждать сильный результат отдельной Arena-метрикой нельзя.
Цена и скорость
В зафиксированном маршруте API вход стоил $0,32 за миллион токенов, выход — $0,80 за миллион токенов. Измеренная скорость генерации составила 139,9 выходного токена в секунду, а время до первого токена — 6,46 секунды. Цена указана за токены, скорость — в токенах в секунду, TTFT — в секундах; эти величины описывают разные стороны сервиса и не должны объединяться в один «процент эффективности».
Профиль подходит для пакетного анализа и генерации длинных результатов: после начала ответа поток идет быстро. Однако TTFT 6,46 секунды может быть заметен в интерактивном чате, особенно если пользователь ожидает мгновенной реакции. Интерфейс стоит проектировать с потоковой выдачей, индикатором выполнения и возможностью отмены запроса.
Для приблизительной оценки бюджета нужно отдельно считать вход и выход. Обработка одного миллиона входных токенов плюс генерация 100 тысяч выходных токенов по значениям паспорта обойдется примерно в $0,40. Это только токенная стоимость выбранного API-маршрута: в нее могут не входить хранение, поиск, повторные запросы, инструменты и собственная инфраструктура.
Цены, лимиты и производительность зависят от провайдера, режима reasoning, длины контекста, батчинга, нагрузки и серверного стека. Значения паспорта относятся к срезу на 31 августа 2026 года и не являются обещанием неизменного тарифа или скорости.
Контекст и развертывание
Open weights дают выбор между внешним API и собственной инфраструктурой. Но «веса доступны» не означает «модель легко запустить». Даже NVFP4-вариант остается системой масштаба 550B total. Официальное руководство TensorRT-LLM указывает многопроцессорные конфигурации для развертывания и рекомендует NVFP4 как вариант с минимальным аппаратным следом для Ultra.
Стек развертывания влияет на результат. В официальных материалах описаны TensorRT-LLM, vLLM и SGLang, reasoning parser, tool parser, MTP, KV-кеш и настройки максимальной длины. Ошибка в шаблоне чата или парсере рассуждений способна ухудшить ответы даже при корректно загруженных весах. Поэтому собственный сервер следует сравнивать с эталонным API на одинаковых промптах.
Официальный максимум до 1M токенов может требовать специальных флагов и большого объема памяти под кеши. Не следует заранее проектировать продукт вокруг предельного контекста: сначала измерьте задержку, пропускную способность и качество поиска на фактической длине ваших документов.
Лицензия и доступность
Чекпойнт распространяется по OpenMDW-1.1. Корректная формулировка — модель с открытыми весами под специальной лицензией. Это не то же самое, что открытое программное обеспечение с неограниченной стандартной OSI-лицензией. Перед коммерческим использованием, модификацией или распространением производных весов нужно изучить актуальный текст OpenMDW-1.1 и провести юридическую проверку применимого сценария.
Суббалл access 96,3 отражает удобство получения и развертывания модели в сравнении с полностью закрытыми системами. Он не учитывает весь объем инженерных работ: загрузку крупных файлов, совместимость рантайма, GPU-инфраструктуру, мониторинг, безопасность и обновление контейнеров.
Ограничения
- Неоднородное качество. Высокая человеческая предпочтительность соседствует с quality 59,1; убедительный стиль не гарантирует верность вывода.
- Слабый сигнал по программированию. Coding равен 34,6, а LMArena Code rating, code rank и соответствующее покрытие отсутствуют.
- Заметная начальная задержка. TTFT 6,46 секунды нужно учитывать в чатах и голосовых интерфейсах.
- Тяжелое локальное размещение. NVFP4 сокращает аппаратный след, но не превращает 550B-модель в решение для одной обычной рабочей станции.
- Предельный контекст зависит от сервинга. Паспорт фиксирует 512 288 токенов, тогда как официальный максимум семейства требует отдельной конфигурации.
- Лицензионные условия. OpenMDW-1.1 необходимо читать как самостоятельное соглашение, а не считать эквивалентом разрешительной лицензии на ПО.
- Средняя уверенность рейтинга. Не все желательные независимые метрики присутствуют; особенно заметен пробел по LMArena Code.
Как проверить на своей задаче
- Соберите 50–200 реальных примеров. Включите типовые запросы, редкие случаи, длинные документы, конфликтующие инструкции и задачи, где ошибка дорого стоит.
- Зафиксируйте конфигурацию. Запишите провайдера, точный model ID, reasoning mode, temperature, лимит вывода, системный промпт и формат инструментов.
- Разделите критерии. Оценивайте фактическую точность, полноту, формат, цитирование источников, задержку и стоимость отдельно.
- Проверьте длинный контекст. Поместите контрольные факты в начало, середину и конец входа. Добавьте похожие отвлекающие фрагменты и измерьте точность извлечения.
- Для кода запускайте результат. Используйте контейнер или песочницу, unit-тесты, линтер, анализ зависимостей и проверку безопасности.
- Измеряйте распределение задержек. Среднего значения недостаточно: сохраните медиану и медленные хвосты для TTFT и полной генерации.
- Сравните API и self-hosted. Одинаковые промпты помогут выявить влияние шаблона чата, квантизации, MTP и серверных настроек.
- Проведите слепую оценку. Эксперты не должны знать, какой системой создан ответ; иначе узнаваемый стиль и ожидания исказят результат.
Критерий приемки лучше определить заранее. Например: не менее заданной доли ответов проходят фактологическую проверку, все действия агента валидируются схемой, p95 задержки укладывается в лимит продукта, а стоимость одной успешно завершенной задачи не превышает установленный бюджет.
Кому подойдет модель
Nemotron 3 Ultra NVFP4 имеет смысл включить в шорт-лист компаниям с GPU-компетенциями, большим объемом конфиденциальных данных или потребностью контролировать серверный стек. Особенно уместны длинные аналитические процессы, RAG по крупным массивам, исследовательские агенты и задачи, где стоимость длинного вывода важнее минимального TTFT.
Модель менее очевидна для небольших команд, которым нужен простой локальный запуск, для приложений с жестким требованием мгновенного первого токена и для продуктов, где главным критерием является автономное программирование. В этих случаях высокий access не отменяет аппаратную сложность и слабый coding-профиль.
FAQ
Что означает COMRAD Score 66,9?
Это нормализованная редакционная оценка по шкале 0–100, рассчитанная из пяти суббаллов с разными весами. Она не означает 66,9% правильных ответов.
Является ли Nemotron 3 Ultra NVFP4 открытым ПО?
Нет. Корректнее говорить о модели с открытыми весами под лицензией OpenMDW-1.1. Условия лицензии нужно проверять отдельно для использования и распространения.
Подходит ли модель для программирования?
Она поддерживает работу с кодом, но суббалл coding составляет 34,6. Отдельных данных LMArena Code в срезе нет, поэтому для кодовых агентов обязателен собственный тест.
Какой у модели контекст?
В паспорте рейтинга зафиксировано 512 288 токенов. Nvidia заявляет для семейства максимум до 1M токенов, однако доступная длина зависит от API, рантайма и конфигурации сервера.
Можно ли развернуть NVFP4 локально?
Веса доступны, но модель требует серьезной многопроцессорной инфраструктуры. NVFP4 уменьшает аппаратный след по сравнению с BF16, не делая развертывание бытовым.
Сколько стоит использование?
В срезе указаны $0,32 за миллион входных и $0,80 за миллион выходных токенов. Тариф зависит от API-провайдера и может измениться.
Почему human preference намного выше quality?
Метрики измеряют разное. LMArena отражает предпочтения пользователей в слепых сравнениях, тогда как quality опирается на независимый интеллектуальный индекс и его редакционную нормализацию.
Источники
- Карточка NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 — точный чекпойнт весов.
- Официальная карточка Nemotron 3 Ultra BF16 — архитектура, разработчик, лицензия, reasoning и характеристики семейства.
- NVIDIA Nemotron 3 Ultra Technical Report — устройство модели, обучение, NVFP4, MTP и варианты чекпойнтов.
- Репозиторий NVIDIA-NeMo/Nemotron — рецепты, документация и руководства по использованию.
- Руководство TensorRT-LLM для Nemotron 3 — требования и параметры развертывания NVFP4.
- Artificial Analysis LLM Leaderboard — Intelligence Index, цена, скорость и контекст в зафиксированном срезе.
- LMArena Text Leaderboard — статистический text rating, место и число голосов.
- OpenMDW License Agreement 1.1 — текст лицензии модели.
