Second Strike обещает показать, как десять ИИ-моделей ведут одну виртуальную войну

В анонсе на Reddit заявлена открытая военная симуляция с участием десяти моделей и воспроизводимыми записями их решений. Подтвердить детали по первичным материалам не удалось.

Иллюстрация к анонсу симуляции Second Strike с участием ИИ-моделей
Иллюстрация к анонсу симуляции Second Strike с участием ИИ-моделей
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-37).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

В Reddit анонсировали Second Strike — военную симуляцию, где десять ИИ-моделей должны соперничать в одной партии. По описанию автора поста, сервис записывает приказы моделей, краткие объяснения решений и доступную им на тот момент игровую информацию. Однако проверить эти подробности по первичному источнику не удалось: страница проекта не предоставлена в читаемом виде.

Что заявлено в анонсе

Пост в r/artificial описывает формат как «арену моделей», но вместо ответов на вопросы участники управляют сторонами в виртуальной войне. В игре, согласно публикации, возможны союзы, предательство и применение ядерного оружия. В списке участников названы Claude, GPT, Grok, Gemini, DeepSeek, Mistral, Qwen, Kimi, Llama и GPT-OSS.

Организаторы, как их пересказывает автор поста, обещают сохранять не только итог партии, но и ход решений: приказы, однострочные объяснения, сведения, которыми располагала модель, и отклонённые команды. Такой журнал мог бы помочь разбирать, почему агент выбрал конкретный ход, а не просто сравнивать победителей. Это потенциальная ценность формата, а не подтверждённый результат испытаний.

Что пока нельзя оценить

В доступных материалах нет официального описания правил, конфигурации моделей, параметров запуска и критериев оценки. Неясно, одинаковые ли условия получают участники, как симуляция обрабатывает случайность и взаимодействуют ли модели напрямую или через игровой интерфейс. Без этих сведений нельзя считать результаты сопоставимым бенчмарком или делать выводы о способности моделей планировать, вести переговоры либо принимать решения в реальных кризисах.

Пост указывает время эфира — 22:45 по восточному времени США, или 02:45 UTC, — и ссылку на secondstrike.io. Это расписание и описание исходят из Reddit-публикации; подтверждения на странице проекта в предоставленных материалах нет.

Почему формат заслуживает внимания

Если заявленные журналы действительно доступны и достаточно подробны, они позволят исследователям и разработчикам изучать поведение ИИ-агентов в многоходовой среде: например, проверять последовательность действий и реакцию на меняющиеся условия. Но игровая симуляция остаётся искусственной задачей. Её результаты зависят от правил, промптов, версий моделей и ограничений интерфейса, а сами объяснения модели не обязательно раскрывают подлинную причину её выбора.

Пока Second Strike корректнее рассматривать как анонс потенциально интересного эксперимента, а не как проверенный тест возможностей моделей. Для оценки нужны доступ к правилам, воспроизводимым партиям и методике сравнения.

Источники:
— Пост в Reddit r/artificial
— Second Strike