
Redactle опубликовал LLM Leaderboard — страницу с результатами того, как языковые модели справляются с игрой Redactle по единым правилам. В игре модель должна делать словесные предположения, пока не откроет все значимые слова заголовка скрытой статьи. На странице указано, что лидерборд обновлён 3 сентября 2026 года, а сами результаты включают короткие и длинные статьи.
Что именно появилось
Redactle теперь показывает сравнительную таблицу конфигураций LLM: каждая метка в лидерборде соответствует полной настройке модели. Визуализация устроена так, что «ниже и левее» означает лучший результат, а выделенный сектор показывает конфигурации, которые находятся ниже медианы сразу по двум метрикам.
По данным страницы, на момент публикации в выборке было 264 из 288 попыток. Неполные конфигурации остаются видимыми, но не ранжируются. Это важная деталь: авторы не смешивают завершённые и незавершённые прогоны в одном рейтинге.
Как считается результат
Оценка строится не просто по факту прохождения, а по числу принятых догадок сверх «пара» — количества слов в заголовке статьи. Если модель раскрывает каждое слово заголовка ровно одной догадкой на слово, она получает 0. Чем больше лишних принятых ходов, тем хуже результат.
Для режимов с подсказками действует штраф: каждая подсказка добавляет 50 очков. В 500-словной оценке прогон останавливается после 30 принятых догадок. Если модель всё ещё решает задачу, попытка получает score 60. Redactle отдельно уточняет, что это экономящий расходы shortcut, а не прогноз того, сколько ходов модели потребовалось бы на самом деле. Для других конфигураций применяется похожее правило — на уровне удвоенного лимита догадок.
Почему это интересно
Такой лидерборд полезен не как универсальный «экзамен интеллекта», а как прикладной тест на сочетание семантического поиска, языковой догадки и стратегии. Модель должна не просто генерировать текст, а итеративно выбирать слова, которые помогут раскрыть скрытый заголовок. Это ближе к агентному поведению, чем к обычному ответу на вопрос.
На Hacker News автор анонса отдельно утверждает, что в его прогонах Gemini Flash оказался особенно сильным по качеству и стоимости. Однако в доступном фрагменте самой страницы Redactle подтверждены прежде всего методика, структура лидерборда и правила подсчёта; конкретные выводы о превосходстве отдельной модели требуют проверки непосредственно по таблице результатов.
Ограничения
Главное ограничение — доменная специфичность. Успех в Redactle не означает, что модель будет лучше писать код, извлекать факты из документов или выполнять рабочие агентные задачи. Это отдельная игровая среда с собственными правилами.
Второе ограничение — неполная воспроизводимость для внешнего читателя. Redactle намеренно не публикует заголовки, выдержки и результаты по отдельным статьям, чтобы не спойлерить головоломки. Это понятно для игрового сервиса, но затрудняет независимую проверку конкретных прогонов.
Практический вывод: лидерборд стоит воспринимать как любопытный и достаточно формализованный сигнал о поведении LLM в задаче словесного поиска, но не как замену бенчмаркам под реальные рабочие сценарии.
Источники