
Когда встаёт вопрос «какую модель поставить в кодинг-агент», ответ чаще всего сводится к перечислению брендов: Claude, GPT, локальная Llama. Но практика последних месяцев показывает, что выбор упирается не в название модели, а в три конкретных параметра: стоимость токенов, размер контекстного окна и уровень автономности, который вы готовы делегировать агенту.
Разберём три реальных конфигурации — проприетарные Claude Code и Codex CLI, а также сборки на открытых моделях — с точки зрения инженера, который пишет код, а не просто тестирует бенчмарки.
Claude Code: когда контекст важнее цены
Claude Code от Anthropic — это агент, работающий поверх моделей семейства Claude. Его ключевое преимущество — контекстное окно до 200K токенов (в версии с Claude 3.5 Sonnet и выше). На практике это означает, что агент может одновременно «видеть» весь репозиторий среднего проекта, не теряя нить диалога.
Что это даёт разработчику
- Рефакторинг跨модульных изменений без дробления задачи на микрошаги.
- Понимание архитектурных связей: Claude Code способен анализировать импорты, типы и сигнатуры функций в рамках одного запроса.
- Возможность загрузить в контекст документацию, спецификацию и примеры кода одной сессией.
Обратная сторона: стоимость. Anthropic тарифицирует Claude 3.5 Sonnet по $3 за миллион входных токенов и $15 за выходные. При активной работе с большим контекстом каждая сессия может обходиться в десятки центов, а при интенсивном использовании — в несколько долларов в день. Для коммерческой разработки это приемлемо, для pet-проекта — ощутимо.
Когда выбирать Claude Code: если вы работаете с монолитным репозиторием, legacy-кодом, где нужно понимать контекст, или когда каждая ошибка агента обходится дороже стоимости токена.
Codex CLI: скорость и дешевизна в обмен на контекст
OpenAI Codex CLI — это агент, построенный на моделях GPT-4o и GPT-4o-mini. Его главная особенность — скорость генерации и низкая цена: GPT-4o-mini стоит $0.15 за миллион входных токенов и $0.60 за выходные. Это примерно в 20-25 раз дешевле Claude 3.5 Sonnet.
Практические последствия
- Вы можете позволить себе «болтливого» агента, который перебирает варианты, не боясь счёта.
- Итеративная разработка: запросить правку, получить результат, переформулировать — цикл почти бесплатный.
- Codex CLI поддерживает выполнение кода в sandbox-окружении, что снижает риск случайного запуска опасных команд.
Ограничение: контекстное окно GPT-4o — 128K токенов, у GPT-4o-mini — 128K, но на практике модель быстрее «забывает» детали начала диалога при длинной сессии. Это проявляется в задачах, где нужно помнить точную сигнатуру функции из первого сообщения через 50 шагов.
Когда выбирать Codex CLI: для прототипирования, одноразовых скриптов, задач с маленьким контекстом и когда бюджет ограничен. Также это хороший выбор для обучения: низкая цена позволяет экспериментировать без финансовой тревоги.
Локальные модели: автономность и приватность с компромиссами
Локальные сборки на базе Llama 3.1, Qwen 2.5, DeepSeek-Coder или Mistral через Ollama, llama.cpp или LM Studio дают полный контроль над данными и отсутствие затрат на API после покупки железа.
Что реально работает
- Модели с 7-8B параметров (Qwen 2.5-Coder-7B, Llama 3.1-8B) успешно справляются с автодополнением, рефакторингом отдельных функций и генерацией тестов.
- DeepSeek-Coder-V2 (16B) показывает результаты, сравнимые с GPT-3.5 на задачах генерации кода средней сложности.
- Квантованные версии (Q4_K_M, Q5_K_M) позволяют запускать 7B-модели на 8-16 ГБ VRAM, а 13-14B — на 16-24 ГБ.
Границы, которые нужно знать
- Контекстное окно локальных моделей ограничено доступной памятью. Для 8B модели с квантизацией Q4 — около 8-16K токенов в зависимости от реализации. Это значит, что агент не увидит весь проект.
- Качество кода на сложных архитектурных задачах (рефакторинг с изменением API, миграция между фреймворками) заметно уступает проприетарным моделям.
- Скорость инференса на потребительском GPU (RTX 4090, 3090) — 15-30 токенов/с для 7B модели, что медленнее API в 5-10 раз.
Когда выбирать локальную модель: если код содержит коммерческую тайну, вы работаете в офлайн-среде, или стоимость API превышает бюджет проекта. Также локальные модели — единственный вариант для задач, где каждая миллисекунда задержки критична, и вы готовы пожертвовать качеством ради предсказуемости.
Сравнительная таблица: три конфигурации
| Параметр | Claude Code (Sonnet) | Codex CLI (GPT-4o-mini) | Локальная сборка (7-8B) |
|---|---|---|---|
| Стоимость входных токенов | $3 / 1M | $0.15 / 1M | Бесплатно (железо) |
| Контекстное окно | 200K | 128K | 8-16K (зависит от RAM) |
| Скорость генерации | 40-60 токенов/с | 50-70 токенов/с | 15-30 токенов/с |
| Приватность | Нет (данные уходят на сервер) | Нет | Полная |
| Качество кода (сложные задачи) | Высокое | Среднее | Ниже среднего |
| Автономность (выполнение кода) | Да (песочница) | Да (песочница) | Да (локально) |
Как выбрать: практический алгоритм
Оцените размер проекта. Если кодовая база больше 50 файлов, а типичная задача затрагивает 3+ модуля — контекстное окно становится критическим. Здесь Claude Code выигрывает.
Посчитайте бюджет. При 100 запросах в день со средним контекстом 10K токенов: Claude Code обойдётся ~$6-8/день, Codex CLI — $0.3-0.5/день. Локальная модель — стоимость электроэнергии.
Проверьте чувствительность данных. Если в коде есть ключи API, пароли или коммерческая логика — локальное исполнение или подписанный NDA с провайдером обязательны.
Протестируйте на репрезентативной задаче. Себастьян Рашка в августе 2025 года провёл сравнение Codex CLI и локального агента на задачах рефакторинга PyTorch-модуля: Codex CLI справился за 4 итерации, локальная модель — за 12 с двумя ошибками импорта. Разрыв значимый, но для простых задач локальный вариант оказался приемлемым.
Ограничения, которые стоит учитывать
- Бенчмарки не отражают реальность. Harbor Adapters (набор из 80+ тестов для агентов) показывает, что разрыв между проприетарными и открытыми моделями на стандартных задачах (генерация юнит-тестов, документирование) минимален, но на задачах с длинным контекстом и архитектурными изменениями — значителен.
- Стоимость локального железа. RTX 4090 стоит ~$1600, и это даёт адекватную производительность только для моделей до 13B. Для 70B моделей (Llama 3.1-70B) потребуется 48+ ГБ VRAM — серверная конфигурация за $5-10K.
- Вендор-лок. Переход с Claude Code на Codex CLI требует переписывания промптов и адаптации под другой формат инструментов. Локальные сборки на llama.cpp универсальны, но требуют ручной настройки.
Что делать прямо сейчас
Скачайте Codex CLI (открытый исходный код на GitHub) и Claude Code (через npm install -g @anthropic-ai/claude-code). Оба работают из терминала.
2. Прогоните одну реальную задачу из вашего проекта на обоих агентах. Замерьте время, количество итераций и качество результата.
3. Если бюджет позволяет — оставьте Claude Code для сложных задач, Codex CLI для рутины.
4. Если бюджет нулевой — настройте Ollama с Qwen 2.5-Coder-7B и проверьте, хватает ли качества для ваших типовых задач.
Выбор модели для кодинг-агента — это не разовый акт, а процесс, который меняется по мере роста проекта и изменения приоритетов. Начните с малого контекста, дешёвого API и простых задач, а затем постепенно расширяйте — так вы не переплатите за ненужную мощность и не упрётесь в ограничения локальной модели в самый неподходящий момент.