XiangqiBench проверяет, доводят ли LLM-агенты шахматный план до победы

Новый бенчмарк оценивает не только выбор хода, но и способность агента выиграть партию против движка. Результаты показывают разрыв между найденным решением и надёжным исполнением.

Позиция в сянци на шахматной доске
Позиция в сянци на шахматной доске
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

На arXiv представили XiangqiBench — бенчмарк для проверки того, способны ли языковые модели не просто назвать сильный ход, а довести партию в сянци до мата против движка. Авторы собрали 119 тактических окончаний с форсированным матом и записали 8568 многоходовых траекторий 12 моделей.

От правильного хода к победе

В статическом тесте достаточно указать удачный ход. В реальной партии соперник отвечает, и агенту нужно учитывать изменившуюся позицию, продолжать план и добиться проверяемого результата. XiangqiBench оценивает именно эту замкнутую цепочку: успехом считается мат, а не совпадение первого хода с эталоном.

Для взаимодействия используется REPL-интерфейс, который разделяет реальные ходы, запросы о состоянии доски и симуляцию продолжения. Модели испытывали по двум протоколам наблюдения. Такой формат позволяет отдельно посмотреть, что агент сделал на доске, что лишь проверил в симуляции и как на его действия ответил движок.

Три разрыва между видимостью и результатом

Авторы выделяют три показателя, которые могут создавать завышенное впечатление о навыках агента.

В испытаниях с видимой позицией модели первым ходом выбирали эталонный вариант в 26,1% случаев. Но только 13,9% таких партий завершились победой. То есть распознать перспективное начало оказалось недостаточно, чтобы реализовать преимущество.

Лидирующая модель получила 38,7% pass@3 — долю позиций, где успех достигался хотя бы в одной из трёх попыток. Но показатель pass^3, требующий выиграть все три раза, составил лишь 5,9%. Из 46 позиций, которые модель выигрывала хотя бы однажды, три победы из трёх она одержала на семи.

Наконец, в 32,3% принятых симуляционных вызовов продолжение останавливалось на нелегальном ходе. А в 49,3% сопоставимых случаев реальный ответ защитника отличался от ответа в линии, которую агент смоделировал. Симуляция помогала проверять допустимость продолжения, но не гарантировала, что противник выберет именно предсказанный вариант.

Что это меняет в оценке агентов

Практический вывод авторов: агентные тесты стоит оценивать по исходу полного взаимодействия и отдельно сообщать надёжность результата наряду с охватом задач. Для систем, которые планируют и действуют через инструменты, единичная удачная попытка или правильный первый шаг не равны воспроизводимому выполнению задачи.

При этом результаты XiangqiBench относятся к конкретному набору позиций, игре в сянци и использованным протоколам. Они не доказывают, что модели столь же ненадёжны в других задачах, и не позволяют автоматически перенести численные показатели на разработку ПО или работу с браузером. Бенчмарк скорее даёт способ поставить более строгий вопрос: завершает ли агент задачу после того, как среда ответила на его действие?

Источники