DeskForge предлагает масштабировать обучение компьютерных агентов на реальных интерфейсах

Исследователи представили DeskForge — управляемую среду для генерации размеченных сцен рабочего стола. По их данным, набор DeskForge-1M улучшил наведение моделей на элементы интерфейса и результаты в задачах длительного взаимодействия с компьютером.

Схематичное изображение рабочего стола с окнами приложений и разметкой элементов интерфейса для обучения компьютерного агента
Схематичное изображение рабочего стола с окнами приложений и разметкой элементов интерфейса для обучения компьютерного агента
Arlington State College Library, students studying (10010394).jpg | by University of Texas at Arlington Photograph Collection | wikimedia_commons | CC BY 4.0

Исследователи представили DeskForge — управляемую среду для подготовки данных о взаимодействии компьютерных агентов с графическими интерфейсами. Работа опубликована на arXiv под номером 2610.02320 5 октября 2026 года. Авторы предлагают не ограничиваться отдельными скриншотами, а автоматически собирать подробные сведения о состоянии рабочего стола, доступных элементах и результате каждого действия.

Проблема — не в распознавании окна, а в выборе точной цели

Агенту, который управляет компьютером, недостаточно понять, какое приложение открыто. В реальной сцене одновременно могут находиться несколько окон, перекрывающие друг друга панели, похожие кнопки и элементы с разным поведением. Модель должна определить, куда именно нажать, какое поле активировать или по какой координате провести действие.

По описанию авторов, существующие наборы данных часто не дают нужной плотности разметки и плохо покрывают разнообразие состояний рабочего стола. Один и тот же интерфейс может выглядеть по-разному в зависимости от содержимого, размера окна, разрешения экрана и набора открытых приложений. При этом для обучения важно знать не только положение элемента, но и то, привело ли действие к ожидаемому результату.

DeskForge задуман как способ контролируемо менять такие условия. Среда компонуёт реальные приложения и варьирует их состояние, содержимое, расположение окон, внешний вид и разрешение. Это позволяет получать сцены, в которых агенту приходится работать не с идеальным макетом, а с комбинациями, близкими к обычному пользовательскому рабочему столу.

Что входит в DeskForge-1M

На основе среды авторы собрали DeskForge-1M — корпус из 1,2 млн размеченных наблюдений рабочего стола. В совокупности в нём насчитывается 159,7 млн экземпляров элементов интерфейса. Под «экземпляром» в работе понимается отдельный объект разметки, связанный с элементом сцены, а не количество уникальных приложений или окон.

Для формирования аннотаций DeskForge объединяет несколько типов информации:

  • изображение рабочего стола;
  • дерево доступности, описывающее структуру интерфейса;
  • геометрию окон и элементов;
  • сведения о выполненном действии и его результате.

Такое объединение важно для обучения моделей, которым нужно сопоставлять визуальный контекст с конкретной целью действия. Скриншот показывает, как выглядит сцена, дерево доступности добавляет структурированное описание, а геометрия помогает связать объект с областью на экране. Запись результата, в свою очередь, позволяет учитывать последствия взаимодействия.

Из общего корпуса авторы использовали 200 тыс. примеров для дообучения четырёх моделей компьютерного зрения и языка. В доступном описании не утверждается, что весь DeskForge-1M целиком применялся в этом эксперименте: отдельно указана именно выборка из 200 тыс. примеров для обучения.

Заявленные результаты на внешних тестах

Авторы сообщают, что все четыре дообученные модели показали улучшение на отложенных условиях рабочего стола и на пяти внешних тестах наведения в графическом интерфейсе. Это означает, что проверка проводилась не только на сценах, использованных при подготовке данных.

Наиболее подробно в аннотации приведён результат для Qwen3.5-4B. На ScreenSpot-Pro точность выросла на 11,51 процентного пункта, а на OSWorld-G — на 10,11 пункта. Эти значения характеризуют изменение результата конкретной модели после дообучения на примерах DeskForge и не означают универсальный прирост для всех компьютерных агентов.

Отдельно исследователи проверили, переносится ли улучшение наведения на более длинные сценарии, где агенту необходимо выполнить последовательность действий. При использовании одного и того же планировщика дообученные модели решили больше задач в WebArena-Infinity и OpenApps.

Для Qwen3.5-4B число решённых задач в WebArena-Infinity увеличилось с 31 до 50 из 119. В OpenApps результат вырос с 3 до 15 из 100. Эти показатели относятся к заявленному авторами эксперименту с фиксированным планировщиком. Поэтому их следует трактовать как результат конкретной связки «планировщик плюс модель», а не как самостоятельную оценку одной только способности модели управлять компьютером.

Почему это может быть полезно разработчикам агентов

Для компьютерных агентов узким местом остаётся связь между намерением и точным действием. Текстовая команда вроде «открой настройки» должна превратиться в выбор конкретного окна, вкладки и кнопки. Ошибка на раннем шаге может сделать бесполезными все последующие действия, даже если план агента в целом составлен правильно.

DeskForge предлагает масштабировать именно этот слой обучения. Управляемая генерация сцен позволяет менять параметры отдельно и проверять, как система переносит знания между разрешениями, раскладками окон и состояниями приложений. Для разработчика это потенциально удобнее, чем вручную собирать небольшое число записей экрана: данные можно связывать с формальными координатами, структурой интерфейса и фактическим исходом действия.

Практическое значение проекта зависит от того, насколько хорошо такие данные переносятся на интерфейсы, которых не было в генераторе, и на нестандартные пользовательские сценарии. В представленной аннотации приведены результаты на нескольких внешних тестах, но по ней нельзя оценить стоимость генерации корпуса, требования к вычислениям, состав использованных приложений или подробные правила фильтрации данных.

Код и материалы проекта

Авторы указывают, что код среды, набор данных и дообученная модель доступны на странице проекта DeskForge. Техническое описание работы также можно открыть в версии статьи в формате PDF.

Перед практическим использованием разработчикам стоит отдельно проверить состав лицензий, требования к окружению и условия распространения каждого компонента. Наличие публичной страницы проекта не заменяет проверку этих условий. Также важно не переносить приведённые авторами значения напрямую на собственное приложение: итоговая точность будет зависеть от интерфейса, разрешения экрана, набора задач и качества планировщика.

Источники