Автор показывает, что проблема была не в модели, а в инструменте: Codex CLI раскрыл Qwen 3.8 Flash Next так, как не удавалось pi.dev или opencode. Интересно, что на синтетическом тесте «3D Mario Game» разница заметна сразу, но главное — реальный проект, где локальная модель вдруг обогнала GPT.
Это хорошая иллюстрация того, что «бенчмарки» и «харанессы» — не пустой звук: один и тот же движок может показывать принципиально разный результат в зависимости от обвязки. Вопрос, который автор оставляет открытым — можно ли добиться того же на pi.dev через расширения — тоже показателен: экосистема инструментов для локальных LLM ещё очень сырая.