Запись архива

Redactle запустил лидерборд LLM: модели сравнивают по игре в угадывание статей

Redactle опубликовал лидерборд для языковых моделей: они угадывают скрытые заголовки статей, а результат считается по числу лишних ходов и стоимости.

Лидерборд языковых моделей для игры Redactle
Лидерборд языковых моделей для игры Redactle
Изображение из исходного материала

Redactle опубликовал LLM Leaderboard — страницу с результатами того, как языковые модели справляются с игрой Redactle по единым правилам. В игре модель должна делать словесные предположения, пока не откроет все значимые слова заголовка скрытой статьи. На странице указано, что лидерборд обновлён 3 сентября 2026 года, а сами результаты включают короткие и длинные статьи.

Что именно появилось

Redactle теперь показывает сравнительную таблицу конфигураций LLM: каждая метка в лидерборде соответствует полной настройке модели. Визуализация устроена так, что «ниже и левее» означает лучший результат, а выделенный сектор показывает конфигурации, которые находятся ниже медианы сразу по двум метрикам.

По данным страницы, на момент публикации в выборке было 264 из 288 попыток. Неполные конфигурации остаются видимыми, но не ранжируются. Это важная деталь: авторы не смешивают завершённые и незавершённые прогоны в одном рейтинге.

Как считается результат

Оценка строится не просто по факту прохождения, а по числу принятых догадок сверх «пара» — количества слов в заголовке статьи. Если модель раскрывает каждое слово заголовка ровно одной догадкой на слово, она получает 0. Чем больше лишних принятых ходов, тем хуже результат.

Для режимов с подсказками действует штраф: каждая подсказка добавляет 50 очков. В 500-словной оценке прогон останавливается после 30 принятых догадок. Если модель всё ещё решает задачу, попытка получает score 60. Redactle отдельно уточняет, что это экономящий расходы shortcut, а не прогноз того, сколько ходов модели потребовалось бы на самом деле. Для других конфигураций применяется похожее правило — на уровне удвоенного лимита догадок.

Почему это интересно

Такой лидерборд полезен не как универсальный «экзамен интеллекта», а как прикладной тест на сочетание семантического поиска, языковой догадки и стратегии. Модель должна не просто генерировать текст, а итеративно выбирать слова, которые помогут раскрыть скрытый заголовок. Это ближе к агентному поведению, чем к обычному ответу на вопрос.

На Hacker News автор анонса отдельно утверждает, что в его прогонах Gemini Flash оказался особенно сильным по качеству и стоимости. Однако в доступном фрагменте самой страницы Redactle подтверждены прежде всего методика, структура лидерборда и правила подсчёта; конкретные выводы о превосходстве отдельной модели требуют проверки непосредственно по таблице результатов.

Ограничения

Главное ограничение — доменная специфичность. Успех в Redactle не означает, что модель будет лучше писать код, извлекать факты из документов или выполнять рабочие агентные задачи. Это отдельная игровая среда с собственными правилами.

Второе ограничение — неполная воспроизводимость для внешнего читателя. Redactle намеренно не публикует заголовки, выдержки и результаты по отдельным статьям, чтобы не спойлерить головоломки. Это понятно для игрового сервиса, но затрудняет независимую проверку конкретных прогонов.

Практический вывод: лидерборд стоит воспринимать как любопытный и достаточно формализованный сигнал о поведении LLM в задаче словесного поиска, но не как замену бенчмаркам под реальные рабочие сценарии.

Источники

Оригинальная страница Redactle LLM Leaderboard: https://redactle.net/llm-leaderboard

Обсуждение на Hacker News: https://news.ycombinator.com/item?id=49544338