H Company представила Holo4 — агентные модели для работы с GUI, кодом, MCP и API

Семейство Holo4 объединяет управление графическим интерфейсом, выполнение кода и вызов инструментов в одной модели. H Company заявляет результат 61,7% для Holo4 27B в OSWorld 2.0, но сравнение стоимости и качества требует учёта разных тестовых стендов.

Схема работы агента Holo4 с графическим интерфейсом, кодом, MCP и API
Схема работы агента Holo4 с графическим интерфейсом, кодом, MCP и API
Изображение из исходного материала

H Company 28 сентября представила Holo4 — семейство агентных моделей, способных в рамках одной задачи управлять графическим интерфейсом, писать и запускать код, а также обращаться к инструментам через MCP и API. В серию вошли плотная модель Holo4 27B и модель Holo4 35B-A3B с архитектурой Mixture of Experts. Обе доступны через H Models API.

Компания также сообщила об обновлении компактной модели Holotron 3 под названием Holotron4 Nano. Подробности о Holo4, примеры задач и результаты тестов опубликованы в официальном материале H Company на Hugging Face.

Главный практический замысел релиза — сократить число отдельных моделей и управляющих модулей, необходимых для автоматизации сложного рабочего процесса. Один агент может нажать элементы на экране, перейти к командной строке, выполнить скрипт, а затем вызвать бизнес-API, если соответствующий интерфейс доступен.

Одна модель вместо отдельных агентов для каждого интерфейса

Многие системы компьютерной автоматизации специализируются на одном способе взаимодействия с программами. Агент, обученный управлять экраном, может оказаться неэффективным там, где быстрее выполнить команду или отправить API-запрос. Агент, ориентированный на вызов инструментов, в свою очередь, не сможет полноценно работать с приложением, у которого нет подходящего API.

По заявлению H Company, Holo4 выбирает доступный способ действия в зависимости от текущего этапа задачи. Модель рассчитана на десктопные приложения, сайты, Android, изолированные среды выполнения кода и корпоративные API. Разработчику не требуется переключаться между разными версиями модели для каждой платформы.

Это не означает, что Holo4 автоматически поддерживает любое приложение. Агенту по-прежнему нужны окружение, набор разрешённых инструментов и исполнительный цикл, который передаёт модели состояние системы и выполняет её команды. Качество также будет зависеть от интерфейса программы, длины сценария и возможности проверить результат.

Модели обучали с помощью обучения с учителем и обучения с подкреплением. В подготовке данных использовалась Agentic Task Factory — внутренняя система H Company, создающая интерактивные окружения и проверяемые задания по документации, снимкам интерфейсов и материалам проектов с открытым исходным кодом. Компания сообщает примерно о 10 000 сгенерированных задачах для веб-приложений, MCP-серверов и настольных программ.

Holo4 27B набрала 61,7% в OSWorld 2.0

В тесте OSWorld 2.0, оценивающем выполнение задач в настольной операционной системе, Holo4 27B получила 61,7%. Для сравнения H Company приводит результат 81,8% у Opus 5.5. Версия Holo4 35B-A3B показала 30,9%.

Таким образом, более крупное обозначение модели не гарантирует более высокого результата в конкретном тесте: в опубликованном сравнении плотная версия 27B заметно опережает вариант 35B-A3B. Компания не раскрыла в представленном материале достаточно деталей, чтобы объяснить эту разницу только архитектурой или числом активных параметров.

H Company позиционирует Holo4 27B как более дешёвую альтернативу ведущим закрытым моделям. Расходы рассчитывались по числу входных и выходных токенов в каждом агентном прогоне с использованием тарифов H Models API. Однако воспринимать диаграмму как универсальный рейтинг цены и качества нельзя: в публикации прямо указано, что модели могли проверяться с разными исполнительными контурами, версиями заданий и подмножествами тестов.

Для AutomationBench компания приводит результаты Holo4 на версии 1.0.6, измеренные во внутреннем стенде. Показатели других моделей частично взяты из публичных материалов и официальной таблицы, использующей закрытый набор заданий. Holo4 на этом закрытом наборе на момент публикации ещё не была оценена, поэтому прямое сравнение остаётся предварительным.

Демонстрации в FreeCAD и Godot

В качестве прикладных примеров разработчики сопоставили Holo4 27B с базовой Qwen3.8 27B. Модели получали одинаковые задания и работали в одном исполнительном контуре.

При построении в FreeCAD детализированной модели Эйфелевой башни Holo4 совершила 84 вызова и обработала около 1,3 млн токенов. Qwen3.8 потребовались 60 вызовов и 1 млн токенов. В этом примере Holo4 не была экономнее по указанным метрикам.

В задаче по созданию трёхмерного логотипа H Company соотношение изменилось: Holo4 выполнила 94 вызова и использовала 1,5 млн токенов, тогда как Qwen3.8 сделала 118 вызовов и обработала 1,9 млн токенов.

Самая заметная разница зафиксирована в задании на разработку автономной игры в стиле Pac-Man в Godot. Агент должен был построить лабиринт, добавить точки, игрока с автоматической навигацией, трёх преследующих его противников, счёт и жизни, а затем запустить игру без участия человека. Holo4 потребовались 68 вызовов, 2,4 млн токенов и 268 строк кода. Qwen3.8 завершила сценарий за 197 вызовов, использовав 11,4 млн токенов и 327 строк.

Эти демонстрации показывают поведение моделей на конкретных заданиях, но не заменяют независимого тестирования. Количество вызовов и токенов зависит не только от модели, но также от системных инструкций, доступных инструментов, структуры памяти и правил остановки агента.

Исполнительный контур получил память и доступ к shell

Показанные результаты относятся не только к самой модели. H Company одновременно переработала harness — программный цикл, который передаёт агенту наблюдения, выполняет действия и управляет контекстом на протяжении сотен шагов.

По описанию разработчиков, агенты отмечали причины неудачного выполнения заданий OSWorld 2.0, после чего инженеры разбирали ошибки и корректировали систему. Среди крупнейших изменений названы долговременная рабочая память для отслеживания сотен действий и доступ к shell непосредственно на настольной машине.

Этот контекст важен при сравнении с другими моделями. Если запустить Holo4 в другом агентном фреймворке без аналогичной памяти, инструментов и механизма восстановления после ошибок, результат может отличаться от опубликованного. И наоборот, часть улучшения может быть связана с обновлённым исполнительным контуром, а не только с весами модели.

Для проверки заявленных прогонов H Company публикует пошаговые записи на портале Holo Trajectories. Там можно посмотреть, какие наблюдения получал агент, какие действия выбирал и на каком этапе возникали ошибки. Компания также размещает свои материалы и модели на странице H Company в Hugging Face, где перед использованием следует проверить доступные файлы, модельные карточки и условия лицензирования конкретного артефакта.

Что проверить перед внедрением Holo4

Командам, рассматривающим Holo4 для автоматизации, полезнее начать не с общего бенчмарка, а с небольшого набора собственных сценариев. В него стоит включить задачи с разными интерфейсами: работу только через GUI, вызов API, выполнение кода и длинную цепочку с переключением между ними.

При тестировании следует отдельно фиксировать долю успешно завершённых заданий, число шагов, расход токенов, время выполнения и стоимость повторных попыток. Для действий с файлами, учётными записями или корпоративными системами агенту понадобятся ограничения прав, журналирование и подтверждение потенциально опасных операций.

Не следует пока считать доказанными одинаковую эффективность во всех приложениях, преимущество над закрытыми моделями на любых задачах или низкую стоимость локального запуска. В опубликованных материалах есть результаты отдельных тестов и открытые траектории, однако независимой оценки Holo4 в реальных корпоративных средах ещё недостаточно.

Источники