
Исследователи представили DeskForge — управляемую среду для подготовки данных о взаимодействии компьютерных агентов с графическими интерфейсами. Работа опубликована на arXiv под номером 2610.02320 5 октября 2026 года. Авторы предлагают не ограничиваться отдельными скриншотами, а автоматически собирать подробные сведения о состоянии рабочего стола, доступных элементах и результате каждого действия.
Проблема — не в распознавании окна, а в выборе точной цели
Агенту, который управляет компьютером, недостаточно понять, какое приложение открыто. В реальной сцене одновременно могут находиться несколько окон, перекрывающие друг друга панели, похожие кнопки и элементы с разным поведением. Модель должна определить, куда именно нажать, какое поле активировать или по какой координате провести действие.
По описанию авторов, существующие наборы данных часто не дают нужной плотности разметки и плохо покрывают разнообразие состояний рабочего стола. Один и тот же интерфейс может выглядеть по-разному в зависимости от содержимого, размера окна, разрешения экрана и набора открытых приложений. При этом для обучения важно знать не только положение элемента, но и то, привело ли действие к ожидаемому результату.
DeskForge задуман как способ контролируемо менять такие условия. Среда компонуёт реальные приложения и варьирует их состояние, содержимое, расположение окон, внешний вид и разрешение. Это позволяет получать сцены, в которых агенту приходится работать не с идеальным макетом, а с комбинациями, близкими к обычному пользовательскому рабочему столу.
Что входит в DeskForge-1M
На основе среды авторы собрали DeskForge-1M — корпус из 1,2 млн размеченных наблюдений рабочего стола. В совокупности в нём насчитывается 159,7 млн экземпляров элементов интерфейса. Под «экземпляром» в работе понимается отдельный объект разметки, связанный с элементом сцены, а не количество уникальных приложений или окон.
Для формирования аннотаций DeskForge объединяет несколько типов информации:
- изображение рабочего стола;
- дерево доступности, описывающее структуру интерфейса;
- геометрию окон и элементов;
- сведения о выполненном действии и его результате.
Такое объединение важно для обучения моделей, которым нужно сопоставлять визуальный контекст с конкретной целью действия. Скриншот показывает, как выглядит сцена, дерево доступности добавляет структурированное описание, а геометрия помогает связать объект с областью на экране. Запись результата, в свою очередь, позволяет учитывать последствия взаимодействия.
Из общего корпуса авторы использовали 200 тыс. примеров для дообучения четырёх моделей компьютерного зрения и языка. В доступном описании не утверждается, что весь DeskForge-1M целиком применялся в этом эксперименте: отдельно указана именно выборка из 200 тыс. примеров для обучения.
Заявленные результаты на внешних тестах
Авторы сообщают, что все четыре дообученные модели показали улучшение на отложенных условиях рабочего стола и на пяти внешних тестах наведения в графическом интерфейсе. Это означает, что проверка проводилась не только на сценах, использованных при подготовке данных.
Наиболее подробно в аннотации приведён результат для Qwen3.5-4B. На ScreenSpot-Pro точность выросла на 11,51 процентного пункта, а на OSWorld-G — на 10,11 пункта. Эти значения характеризуют изменение результата конкретной модели после дообучения на примерах DeskForge и не означают универсальный прирост для всех компьютерных агентов.
Отдельно исследователи проверили, переносится ли улучшение наведения на более длинные сценарии, где агенту необходимо выполнить последовательность действий. При использовании одного и того же планировщика дообученные модели решили больше задач в WebArena-Infinity и OpenApps.
Для Qwen3.5-4B число решённых задач в WebArena-Infinity увеличилось с 31 до 50 из 119. В OpenApps результат вырос с 3 до 15 из 100. Эти показатели относятся к заявленному авторами эксперименту с фиксированным планировщиком. Поэтому их следует трактовать как результат конкретной связки «планировщик плюс модель», а не как самостоятельную оценку одной только способности модели управлять компьютером.
Почему это может быть полезно разработчикам агентов
Для компьютерных агентов узким местом остаётся связь между намерением и точным действием. Текстовая команда вроде «открой настройки» должна превратиться в выбор конкретного окна, вкладки и кнопки. Ошибка на раннем шаге может сделать бесполезными все последующие действия, даже если план агента в целом составлен правильно.
DeskForge предлагает масштабировать именно этот слой обучения. Управляемая генерация сцен позволяет менять параметры отдельно и проверять, как система переносит знания между разрешениями, раскладками окон и состояниями приложений. Для разработчика это потенциально удобнее, чем вручную собирать небольшое число записей экрана: данные можно связывать с формальными координатами, структурой интерфейса и фактическим исходом действия.
Практическое значение проекта зависит от того, насколько хорошо такие данные переносятся на интерфейсы, которых не было в генераторе, и на нестандартные пользовательские сценарии. В представленной аннотации приведены результаты на нескольких внешних тестах, но по ней нельзя оценить стоимость генерации корпуса, требования к вычислениям, состав использованных приложений или подробные правила фильтрации данных.
Код и материалы проекта
Авторы указывают, что код среды, набор данных и дообученная модель доступны на странице проекта DeskForge. Техническое описание работы также можно открыть в версии статьи в формате PDF.
Перед практическим использованием разработчикам стоит отдельно проверить состав лицензий, требования к окружению и условия распространения каждого компонента. Наличие публичной страницы проекта не заменяет проверку этих условий. Также важно не переносить приведённые авторами значения напрямую на собственное приложение: итоговая точность будет зависеть от интерфейса, разрешения экрана, набора задач и качества планировщика.









