Запись архива

Как игры учат ИИ: эксперимент Good Start Labs с переносом навыков в финансовые задачи

Стартап Good Start Labs обучил языковую модель на классической железнодорожной стратегии и выяснил, при каких условиях игровой опыт улучшает результаты в финансовых исследованиях.

Иллюстрация к исследованию переноса игровых навыков языковых моделей в реальные рабочие задачи
Иллюстрация к исследованию переноса игровых навыков языковых моделей в реальные рабочие задачи
Изображение из исходного материала

Исследовательский интерес к использованию компьютерных и настольных игр в качестве полигонов для тренировки искусственного интеллекта продолжает расширяться. Новый проект стартапа Good Start Labs демонстрирует, что правильная архитектура обучающей среды позволяет языковым моделям переносить стратегические и аналитические навыки из игрового контекста на прикладные рабочие задачи, включая финансовые исследования и обработку табличных данных.

Стартап выделился в самостоятельную компанию из структуры медиа- и ИИ-компании Every в октябре 2025 года, получив инвестиции в размере 3,6 миллиона долларов от таких венчурных фондов, как General Catalyst, Inovia, а также при участии Every и бизнес-ангелов. Идея проекта зародилась во время трансляций 2025 года, когда передовые языковые модели соревновались в политической стратегической игре Diplomacy. По словам соучредителя и генерального директора компании Алекса Даффи, наблюдение за поведением различных архитектур в условиях открытого блефа и долговременного планирования показало, что выбор тренировочной среды напрямую влияет на формирование когнитивных паттернов моделей.

Эволюция игровых тренировок для языковых моделей

В ходе экспериментов с игрой Diplomacy разработчики обратили внимание, что модели демонстрируют кардинально разную склонность к сотрудничеству и обману. Например, версия OpenAI o3 успешно использовала долгосрочное планирование с расчетом на будущую смену альянсов, в то время как модели от других разработчиков сталкивались с трудностями из-за прямолинейного следования инструкциям. На основе этих наблюдений авторы пришли к выводу, что тонкая настройка моделей на играх с проверяемыми результатами способна улучшать базовые показатели в промышленных операциях и клиентской поддержке.

Главным вопросом для исследователей оставалось то, насколько эффективно подобные стратегические навыки транслируются за пределы конкретного игрового симулятора. Чтобы проверить гипотезу переноса навыков на финансовые задачи, команда Good Start Labs провела эксперимент с классической железнодорожной стратегией 1830: The Game of Railroads and Robber Barons. В этой настольной игре участники управляют логистическими сетями и торгуют акциями компаний в условиях рыночной конкуренции, где элемент случайности сведен к минимуму.

Архитектура обучения и проверка гипотезы

Для эксперимента исследователи взяли модель с параметрами в 30 миллиардов, обучили ее внутри игровой среды 1830, а затем протестировали ее возможности на специализированных бенчмарках финансовых исследований. В процессе тестирования разработчики сравнили два принципиально разных подхода к организации тренировочного процесса.

Первый подход представлял собой традиционный одношаговый анализ состояния игры, когда модель получает фиксированную расстановку сил и должна выбрать следующий ход. Второй подход опирался на многошагового терминального агента, который самостоятельно задействовал внешние инструменты для поиска информации в игровой базе данных, формирования стратегии, заполнения таблиц Excel, написания вспомогательных функций и вычисления итогового ответа.

Результаты эксперимента показали, что хотя оба метода улучшили показатели моделей внутри самого симулятора, задачу внешнего финансового бенчмарка успешно преодолел исключительно агент, обученный по второму сценарию с применением инструментов и многошаговой архитектуры. По мнению разработчиков, это подтверждает ключевое значение дизайна обучающей среды, которая определяет характер взаимодействия модели с данными.

Перспективы и ограничения метода

Помимо структуры самой среды, создатели Good Start Labs изучают возможность добавления экспертных моделей для генерации более плотных пошаговых наград. Исследователи отмечают, что представление одной и той же задачи в виде визуальных образов, сырого текста или через программный код вроде Python формирует у нейросети совершенно разные типы когнитивных навыков.

Дальнейшее развитие этих идей отражено в научной работе COS-PLAY: Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks, созданной в соавторстве с исследователями из нескольких университетов. В предложенном подходе система сочетает агент принятия решений с обучаемым банком навыков, который корректируется на основе предыдущих траекторий запусков.

Отвечая на вопрос о влиянии появления новых базовых моделей на значимость подобных тренировочных сред, создатели стартапа отмечают, что более мощные версии действительно справляются с задачами с меньшим количеством подсказок. Тем не менее, когда речь заходит о строгом контроле за ходом рассуждений — например, о принудительном использовании кода вместо вычислений «в уме» для обеспечения прозрачности и проверяемости результатов, — роль внешней обучающей обвязки и архитектуры агента не только не снижается, но и возрастает.

Источники:
— Latent Space — https://www.latent.space/p/good-start-labs
— Every — https://every.to/
— Wikipedia (1830: The Game of Railroads and Robber Barons) — https://en.wikipedia.org/wiki/1830:_The_Game_of_Railroads_and_Robber_Barons

Источники