Запись архива

Harness меняет всё: как инструмент влияет на восприятие локальных LLM

Автор делится опытом: смена клиента (Codex CLI вместо pi.dev и opencode) кардинально изменила качество работы Qwen 3.8 Flash Next, обогнав даже GPT.

Harness меняет всё: как инструмент влияет на восприятие локальных LLM
Redditr/LocalLLaMA

Встроенный пост загружается с Reddit. Если он недоступен, откройте источник.

Открыть оригинал

Автор показывает, что проблема была не в модели, а в инструменте: Codex CLI раскрыл Qwen 3.8 Flash Next так, как не удавалось pi.dev или opencode. Интересно, что на синтетическом тесте «3D Mario Game» разница заметна сразу, но главное — реальный проект, где локальная модель вдруг обогнала GPT.

Это хорошая иллюстрация того, что «бенчмарки» и «харанессы» — не пустой звук: один и тот же движок может показывать принципиально разный результат в зависимости от обвязки. Вопрос, который автор оставляет открытым — можно ли добиться того же на pi.dev через расширения — тоже показателен: экосистема инструментов для локальных LLM ещё очень сырая.