Запись архива

GPT-6 Astra Pro на MineBench: генерация без единой ошибки и радикальное снижение стоимости

Свежее тестирование MineBench демонстрирует, что GPT-6 Astra Pro превосходит предшественника не только по качеству сборок, но и по надёжности: ноль ошибок при первом запуске против множества ретраев у GPT-5.6 Sol.

Сравнение генераций GPT-5.6 Sol и GPT-6 Astra Pro на платформе MineBench
Сравнение генераций GPT-5.6 Sol и GPT-6 Astra Pro на платформе MineBench
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Пользователь Reddit под ником Ammaar-Alam опубликовал результаты тестирования GPT-6 Astra Pro на платформе MineBench.ai, которая оценивает способность моделей генерировать трёхмерные сборки (по аналогии с Minecraft). Результаты оказались неожиданными: новая модель OpenAI показала радикальное улучшение по ключевым метрикам по сравнению с GPT-5.6 Sol.

Что изменилось: надёжность и стоимость

Основной вывод тестирования — GPT-6 Astra Pro не потребовала ни одной повторной попытки при генерации 15 сборок. Для GPT-5.6 Sol ретраи были нормой. Это напрямую повлияло на стоимость: Astra обошлась примерно в $34,71 против $710,82 у Sol. Автор отмечает, что данные по затратам могут уточняться (дашборд OpenAI пока показывает $0), но разница в 20 раз уже очевидна.

Среднее время инференса у Astra составило 40 минут 12 секунд, что почти вдвое дольше, чем у Sol (18 минут 4 секунды). Однако средний размер JSON-вывода вырос с 91,58 MiB до 128,53 MiB — модель генерирует более детализированные и комплексные сцены.

Качество сборок: фотореализм и понимание контекста

По словам автора теста, некоторые сборки Astra выглядят «скорее как фотореалистичные сцены из Blender, а не как воксельные постройки». Модель демонстрирует лучшее понимание того, что важно в конкретном запросе: когда добавлять окружение, а когда сосредоточиться на основном объекте.

Отдельно отмечена согласованность в отображении текста. Единственный случай, когда текст оказался перевёрнутым, — вывеска «Atlas» на небоскрёбе. Для предыдущих поколений моделей подобные ошибки были массовыми.

Ограничения и контекст

Автор прямо заявляет, что не готов согласиться с Грегом Брокманом, назвавшим эту модель AGI. Тестирование ограничено одной задачей (3D-генерация) и не охватывает другие аспекты интеллекта. Кроме того, время генерации осталось на уровне предыдущего поколения — быстрым Astra назвать нельзя.

Стоит также учитывать, что тест проводился на специфическом бенчмарке MineBench, который не является общепринятым стандартом оценки LLM. Результаты могут не коррелировать с производительностью на других задачах.

Практическая ценность

Для разработчиков, работающих с генерацией контента, GPT-6 Astra Pro предлагает два ключевых преимущества:

Предсказуемость — отсутствие ретраев упрощает пайплайны и снижает операционные расходы.

Экономия — даже с учётом более длительного времени инференса, итоговая стоимость значительно ниже.

Однако для задач, где критично время ответа, модель может оказаться непригодной из-за двукратного увеличения времени генерации.

Источники

Оригинальный пост на Reddit: https://www.reddit.com/r/OpenAI/comments/1w8619g/differences_between_gpt56_sol_pro_and_gpt6_astra/

Репозиторий бенчмарка MineBench: https://github.com/Ammaar-Alam/minebench

Платформа для тестирования: https://minebench.ai/

Официальный сайт OpenAI: https://openai.com/news/