Автор делится любопытным подходом к бенчмаркингу внутри OpenAI: вместо абстрактных тестов модели получают одну и ту же практическую задачу — переписать десктопный Codex на Rust и GPUI. Это не просто генерация кода, а полноценная сборка нативного приложения под несколько платформ.
Сложность в том, что сам Codex развивается быстрее, чем модель успевает зафиксировать актуальную версию. Идея в том, чтобы одна модель могла одновременно поддерживать Mac, Windows и версию на Rust — пока это предел, но команда говорит, что стали ближе. Интересно посмотреть, когда это превратится из теста в реальный рабочий процесс.







