Nonobench v1.2: открытая DeepSeek делит четвёртое место, но не решает 20×20

В обновлённом тесте Nonobench сравнили 43 модели на японских кроссвордах. DeepSeek V4 Pro показала 83% на основном наборе, но все открытые модели получили 0 из 10 в новом режиме 20×20.

Сетка японского кроссворда — нонограмма, используемая для проверки логических способностей языковых моделей
Сетка японского кроссворда — нонограмма, используемая для проверки логических способностей языковых моделей
Lipu tenpo nanpa ma — sitelen Non (akesi).png | by kulupu pi lipu tenpo | wikimedia_commons | CC BY-SA 4.0

В Nonobench v1.2 сравнили 43 языковые модели на нонограммах — японских кроссвордах, где картинку восстанавливают по числам в строках и столбцах. По опубликованному автором теста описанию, DeepSeek V4 Pro набрала 83% на основном наборе и делит четвёртое место. В новом режиме Hard ни одна из протестированных моделей с открытыми весами не решила ни одной задачи из десяти размером 20×20.

Что изменили в тесте

Обновление учитывает замечания к предыдущей версии. Усилие рассуждения теперь указывается для каждого запуска, а промпты и ответы доступны публично. Кроме того, задачи Hard требуют отвечать по строкам: такой формат должен снижать вероятность ошибки при подсчёте символов в длинной строке.

Это важно для интерпретации результатов. Тест проверяет не только способность модели рассуждать о логике задачи, но и то, насколько надёжно она выдаёт ответ в требуемом формате. Ошибка в подсчёте или записи может испортить результат даже при верном ходе решения.

Результаты и границы сравнения

Автор сообщает, что GPT-6 Astra решила все 30 задач основного набора 15×15 — это первый идеальный результат в опубликованных прогонах Nonobench. DeepSeek V4 Pro показала 83%, а DeepSeek V4.1 Flash — 77%; для последней автор указывает общую стоимость запуска $0,84.

В Hard проверили десять случайных нонограмм 20×20, у каждой — одно решение. Лучший результат, согласно посту, у Opus 5.5: 8 из 10. Все открытые модели получили 0 из 10. Это результат именно данной выборки и конфигурации теста, а не доказательство того, что открытые модели в принципе неспособны решать задачи такого размера.

Практический смысл

Nonobench даёт разработчикам наглядный пример того, как модели справляются с многошаговой логической задачей и точным структурированным выводом. Публикация промптов и ответов позволяет изучать отдельные ошибки, а не ограничиваться итоговой таблицей.

Но один бенчмарк не даёт основания напрямую переносить рейтинг на программирование, агентные сценарии или другие виды рассуждений. Результаты зависят от набора головоломок, параметров запуска и правил оценки. Кроме того, автор отмечает, что пока тест запускается только через API и локальный запуск недоступен.

Источники:
— Пост о Nonobench v1.2 в Reddit r/LocalLLaMA
— Сайт Nonobench