Запись архива

Локальные кодинг-агенты на открытых моделях: Себастьян Рашка тестирует альтернативу Codex и Claude Code

Себастьян Рашка описал локальный стек для кодинг-агентов на базе open-weight моделей, Qwen-Code и локального сервера инференса. Автор объясняет, где такая схема выигрывает у облачных подписок и какие ограничения сохраняются.

Локальный кодинг-агент Qwen-Code с моделью Qwen3.6 в терминале
Локальный кодинг-агент Qwen-Code с моделью Qwen3.6 в терминале
Изображение из исходного материала

Себастьян Рашка, исследователь машинного обучения и автор рассылки Ahead of AI, опубликовал разбор локальных кодинг-агентов. В статье Using Local Coding Agents он показывает, как связать open-weight LLM с локальным сервером инференса и инструментом, который умеет читать файлы, редактировать код, выполнять команды и проверять изменения.

Главный тезис материала — локальная модель может стать практичной альтернативой облачным агентам, если у разработчика уже есть подходящее оборудование и он готов самостоятельно настраивать рабочую среду. Рашка при этом не объявляет отказ от Codex или Claude Code: по его словам, именно эти сервисы пока остаются его основными инструментами из-за лимитов подписок и быстро развивающихся функций.

Зачем разработчику локальный агент

Рашка выделяет несколько причин держать локальный стек хотя бы в качестве дополнительного инструмента. Первая — контроль над данными. В качестве примера он приводит обработку чеков и других личных документов: такие файлы ему удобнее передавать локальной модели, чем отправлять их внешнему провайдеру.

Вторая причина — предсказуемость среды. Обновление облачной модели может повысить качество ответов, но одновременно изменить поведение уже настроенного рабочего процесса. Зафиксированная локальная модель дает больше воспроизводимости, хотя разработчику приходится самостоятельно следить за обновлениями и совместимостью компонентов.

Третья — отсутствие обязательной подписки и возможность работать без подключения к интернету. Это не означает, что локальный запуск бесплатен: расходы переносятся на видеопамять или оперативную память, электричество, настройку и обслуживание оборудования. При наличии подходящей машины каждый дополнительный запуск действительно не требует отдельной оплаты API, но стоимость владения остается важным фактором.

Почему автор делает ставку на Qwen-Code

В качестве основного варианта Рашка рассматривает Qwen-Code — открытый кодинг-харнес для моделей семейства Qwen. В его схеме языковая модель отвечает за рассуждения и генерацию кода, а харнес предоставляет доступ к проекту, терминалу и операциям проверки.

Автор объясняет выбор несколькими причинами. Qwen-Code распространяется как открытый инструмент, а модели Qwen, по его оценке, специально под него оптимизируются. Кроме того, такой клиент можно использовать параллельно с Codex, не переключая вручную одну и ту же рабочую среду между локальной и облачной моделью.

В качестве подтверждения Рашка приводит результаты работы Nvidia Polar: Agentic RL on Any Harness at Scale. В опубликованном бенчмарке сравнивается поведение базовой модели Qwen3.5-4B в разных харнесах; лучший результат для нее показан в Qwen-Code. Результаты исследования доступны на arXiv: https://arxiv.org/abs/2605.24220.

Это важная, но ограниченная опора для вывода. Бенчмарк касается конкретной модели, версии инструментов и набора задач. Он не доказывает, что Qwen-Code будет лучшим выбором для любого проекта или что более новая модель автоматически сохранит такое же преимущество. Сам Рашка лишь предполагает, что Qwen3.6 могла получить дополнительные оптимизации под собственный харнес.

Конфигурация Qwen3.6 и требования к памяти

В практической части автор использует Qwen3.6 35B-A3B. По его данным, файл модели занимает около 22 ГБ, а для запуска требуется примерно 30–40 ГБ оперативной памяти. Рашка говорит, что проверял эту конфигурацию на Mac Mini с чипом M4 и DGX Spark и получил достаточно высокую скорость работы.

Эти цифры стоит воспринимать как ориентир, а не как универсальные системные требования. Итоговая скорость зависит от формата весов, настроек квантования, используемого рантайма, длины контекста и характера задачи. Для агента, который одновременно держит в памяти модель, проект и результаты команд, минимальный объем памяти может оказаться неудобным.

Рашка также ссылается на июньский отчет Cohere North от Mini Code и называет Qwen3.6 35B-A3B лучшей локальной моделью в своем классе по приведенным там результатам. Это позиционирование основано на внешнем сравнении, а не на самостоятельном тестировании автора. Перед выбором модели разработчику стоит проверить именно те сценарии, которые важны ему: исправление ошибок, работа с большим репозиторием, запуск тестов и соблюдение ограничений проекта.

Codex, Claude Code, Cline и Pi

Рассмотренная схема не ограничивается Qwen-Code. Рашка описывает возможность использовать локальные open-weight модели с Codex и Claude Code, а также упоминает Cline и Pi. При этом совместимость инструмента с моделью еще не означает одинаковое качество работы: разные харнесы по-разному формируют контекст, вызывают команды и обрабатывают результаты выполнения.

Codex автор относит к открытым инструментам и ссылается на его репозиторий: https://github.com/openai/codex. Claude Code, напротив, в статье приведен как пример проприетарного клиента. Рашка считает, что разработчику полезно уметь работать с несколькими харнесами: облачный агент может оставаться основным, а локальный — использоваться для приватных данных, автономной работы или экспериментов.

Отдельно автор отмечает Pi, который планирует изучить подробнее. Проект доступен по адресу https://github.com/earendil-works/pi. В рамках опубликованного материала Pi не сравнивается с Qwen-Code на равных условиях, поэтому делать вывод о его превосходстве или недостатках пока рано.

Что проверить перед переходом

Практический вывод из статьи Рашки не сводится к простой замене подписки локальной моделью. Сначала нужно проверить четыре пункта: хватает ли памяти с учетом самого проекта, работает ли выбранный рантайм с нужным форматом модели, может ли агент безопасно выполнять команды и устраивает ли качество на реальном репозитории.

Особое внимание стоит уделить разрешениям. Кодинг-харнес получает доступ к файлам и терминалу, поэтому локальность модели сама по себе не делает запуск безопасным. Для эксперимента разумно использовать отдельную копию проекта, ограничить команды и проверить, какие действия агент выполняет без дополнительного подтверждения.

Статья Рашки полезна прежде всего как подробная схема сборки и отправная точка для собственных тестов. Она показывает, что локальные агенты уже можно рассматривать как рабочий резерв для разработчика, но приведенные в ней оценки скорости и качества зависят от конкретной модели, харнеса, железа и набора задач.

Источники