Запись архива

Holo3.1: H Company выпускает семейство моделей для компьютерного зрения с локальным исполнением и квантованными весами

H Company представила Holo3.1 — новое семейство моделей для компьютерного зрения (computer use), ориентированное на локальное исполнение, поддержку мобильных сред и интеграцию со сторонними агентными фреймворками. В релиз вошли квантованные веса FP8, Q4 GGUF и NVFP4 для быстрого инференса на потребительском железе.

Карточка модели Holo3.1 на Hugging Face с информацией о версиях и квантизации
Карточка модели Holo3.1 на Hugging Face с информацией о версиях и квантизации
Изображение из исходного материала

H Company, разработчик открытой модели компьютерного зрения Holo3, представила Holo3.1 — новое семейство моделей, ориентированное на локальное и мобильное исполнение, а также на бесшовную интеграцию со сторонними агентными фреймворками. Релиз, опубликованный в блоге Hugging Face 2 июня 2026 года, включает первые официальные квантованные веса: FP8, Q4 GGUF и NVFP4, что позволяет запускать агентов на потребительском оборудовании без потери качества.

Что нового в Holo3.1

Основное изменение в Holo3.1 — расширение поддерживаемых сред. Если Holo3 был ориентирован в первую очередь на браузерный и десктопный контроль, то новая версия демонстрирует значительный прирост в мобильных сценариях. На бенчмарке AndroidWorld модель 35B-A3B улучшила результат с 67% до 79.3%, а младшие версии 4B и 9B — с 58% до 72%.

Ключевые нововведения:

  • Поддержка протоколов функционального вызова (function-calling) наравне со структурированным JSON, что упрощает интеграцию с популярными агентными фреймворками.
  • Собственный бенчмарк H Company (H Corporate) — OSWorld и внутренние тесты на электронной коммерции, бизнес-софте и коллаборативных инструментах показывают прирост более 25% по сравнению с Holo3.
  • Четыре размера модели: 0.8B, 4B, 9B и 35B-A3B (35 миллиардов параметров, 3 миллиарда активных через Mixture-of-Experts) — для гибкого выбора между стоимостью и производительностью.

Квантованные веса и локальное исполнение

Впервые H Company выпускает официальные квантованные чекпоинты. Для старшей модели 35B-A3B доступны три формата:

  • FP8 — стандартная квантизация с минимальной потерей точности (OSWorld: разница около 2 пунктов относительно BF16).
  • NVFP4 (W4A16) — оптимизированная квантизация для NVIDIA DGX Spark через Model Optimizer. На DGX Spark NVFP4 обеспечивает 1.41× пропускную способность токенов по сравнению с FP8 и 1.74× по сравнению с BF16.
  • Q4 GGUF — для локального запуска на потребительском оборудовании (Windows, Mac, Apple Silicon). Модель может работать на том же устройстве, что и агентный харнес, либо на DGX Spark в той же сети, обеспечивая полную приватность — данные не покидают локальную сеть пользователя.

Совокупный прирост скорости end-to-end на DGX Spark при использовании NVFP4 достигает 2× относительно FP8: среднее время шага снизилось с 6.8 до 3.3 секунды.

Интеграция с агентными фреймворками и сторонние квантизации

Holo3.1 поставляется с нативной поддержкой function-calling, что позволяет подключать модель к любым современным агентным харнесам — от LangChain и CrewAI до собственных решений. На внутренних тестах H Company функциональный вызов и нативное исполнение показывают почти идентичную производительность по сравнению со структурированным JSON.

Параллельно с официальным релизом сообщество уже адаптирует модель. Пользователь mradermacher выпустил iMatrix-кванты для Holo3.1 0.8B и Holo3 35B-A3B в формате GGUF, доступные на Hugging Face. Это расширяет возможности локального запуска на CPU и GPU с ограниченной памятью. Для Holo3.1 0.8B доступны статические и iMatrix-кванты, включая mmproj-файлы для vision-моделей.

Практическое значение для разработчиков

Релиз Holo3.1 решает несколько ключевых проблем, с которыми сталкивались разработчики при внедрении Holo3:

Переносимость между средами. Модель теперь одинаково эффективна на вебе, десктопе и мобильных устройствах, что критично для агентов, работающих в гетерогенных средах.
2. Локальная приватность. Квантованные веса позволяют запускать агента полностью локально, без отправки данных в облако. Для конфиденциальных рабочих процессов (финансы, медицина, корпоративные данные) это снимает основные ограничения.
3. Гибкость интеграции. Поддержка function-calling упрощает встраивание Holo3.1 в существующие агентные пайплайны без переписывания кода.
4. Стоимость. Размеры от 0.8B до 9B позволяют подобрать модель под конкретный бюджет и требования к производительности, что особенно важно для стартапов и индивидуальных разработчиков.

Ограничения и что стоит проверить

Несмотря на впечатляющие цифры, стоит учитывать несколько моментов. Во-первых, бенчмарки OSWorld и AndroidWorld — это внутренние тесты H Company. Независимые оценки от сообщества пока ограничены: на момент публикации есть отдельные упоминания использования Holo3 в визуальном E2E-тестировании (например, в статье Zak El Fassi о тестировании Chrome-расширений), но массовых независимых бенчмарков Holo3.1 пока нет.

Во-вторых, iMatrix-кванты от mradermacher — это сторонняя работа, не сертифицированная H Company. Хотя они расширяют доступность модели, качество может варьироваться в зависимости от конкретного кванта и оборудования.

В-третьих, заявленная производительность на DGX Spark с NVFP4 достигнута в оптимизированной среде, и на обычных потребительских GPU результаты могут отличаться.

Что дальше

H Company обещает выпустить обновленный десктопный агентный харнес, в котором будут реализованы все улучшения Holo3.1, включая оптимизации для NVFP4. Разработчики могут уже сейчас протестировать модели через официальный Hugging Face-репозиторий, а также через API H Company (бесплатный тариф: 10 RPM, $0.25/1M входных токенов, $1.80/1M выходных).

Для тех, кто хочет попробовать модель локально, рекомендуется начать с Q4 GGUF-кванта 35B-A3B на Apple Silicon (требуется ~21 ГБ унифицированной памяти) или с 9B-версии для GPU с 8-12 ГБ VRAM.

Источники