✅ Подходит: разработчикам и infra-инженерам, которым нужен локальный или self-hosted inference для LLM с контролем над сборкой, backend-ами и способом деплоя. ❌ Не подходит: тем, кто ищет готовый SaaS с тарифами, SLA, GUI по умолчанию и полностью описанной privacy policy. 💡 Ключевое преимущество: у llama.cpp есть несколько официальных путей старта: llama.app, Docker, готовые бинарники из Releases и сборка из исходников.
Практический вердикт: если вы готовы работать с CLI, CMake и контейнерами, llama.cpp выглядит как сильная базовая прослойка для локального inference. Если вам нужен более простой старт без ручной сборки, сначала сравните его с Ollama.
- Разработчик: ggml-org
- Тип: self-hosted / CLI / server / Docker / сборка из исходников
- Официальный URL: llama.app; код и README — ggml-org/llama.cpp
- Лицензия: MIT
- Текущий релиз по GitHub Releases:
b10405от 2026-08-13 07:32 - Дата проверки: 2026-08-13
Что умеет
- Запускать inference LLM на базе проекта ggml-org в C/C++.
- Работать через CLI: в README приведён пример проверки с
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF. - Поднимать серверный режим: в README есть пример
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF. - Собираться из исходников через CMake: официальный путь начинается с
git clone, затемcmake -B buildиcmake --build build --config Release. - Ставиться через готовые каналы установки: conda-forge, Winget, Homebrew, MacPorts и Nix.
- Запускаться в контейнерах: официальная документация перечисляет семейства образов full, light, server и GPU/backend-specific variants.
Как использовать
Ниже — базовый workflow для разработчика, который хочет сначала собрать llama.cpp из исходников, а затем проверить CLI и server mode. Это воспроизводимый путь из официальных документов, но зависимости и backend-настройки зависят от вашей платформы и ускорителя.
- Склонируйте репозиторий.
git clone https://github.com/ggml-org/llama.cpp - Соберите проект.
cmake -B build cmake --build build --config Release - Проверьте CLI на модели из примера README.
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUFЕсли вам нужен именно локальный API/сервер, используйте второй официальный пример:
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF - Если собираете вариант с Vulkan, отдельно проверьте GPU.
./build/bin/llama-cli -m "PATH_TO_MODEL" -p "Hi you how are you" -ngl 99Официальная документация пишет, что в ожидаемом выводе должно появиться сообщение о том, что
ggml_vulkanобнаружил ваш GPU.
Если сборка из исходников вам не подходит, официальный quick start также допускает три другие ветки: готовые релизные бинарники, Docker и llama.app.
Тарифы и ограничения
У llama.cpp в проверенном наборе официальных источников нет коммерческих тарифных планов в формате SaaS. Это MIT-licensed проект; вместо «планов» есть разные каналы установки и разные операционные ограничения.
| Вариант | Цена | Лимиты и ограничения |
|---|---|---|
| Build from source | Официальная цена не указана | Требуется рабочий toolchain и backend-specific зависимости; шаги зависят от платформы и ускорителя. |
| Pre-built release binaries | Официальная цена не указана | Assets зависят от релиза и платформы; состав загрузок меняется по мере публикации новых релизов. |
| Docker images | Официальная цена не указана | Нужен Docker; для GPU-образов официальная документация предупреждает, что они не полностью CI-tested beyond builds и иногда требуют локальной пересборки под точные версии CUDA/ROCm/MUSA. |
| llama.app | Официальная цена не указана | Перед использованием нужно отдельно проверить поддержку вашей ОС, региона и поведение bootstrap-скрипта на момент установки. |
Дата проверки: 2026-08-13. Текущий релиз на GitHub Releases: b10405 от 2026-08-13 07:32.
Ограничение карточки: в предоставленном официальном наборе источников нет pricing page самого llama.cpp, поэтому здесь нельзя честно указать цены, лимиты запросов или способы оплаты как у коммерческого сервиса.
Работа с данными и приватность
По устройству инструмента, показанному в README, build- и docker-документации, вы запускаете локальные бинарники или контейнеры и сами передаёте им модель и входные данные. На практике это означает, что llama.cpp видит те промпты, модели и параметры запуска, которые вы подаёте в CLI или server mode.
- Что получает инструмент: модель, текст запроса и параметры запуска, которые вы передаёте локальным бинарникам или контейнеру.
- Использование данных для обучения: в проверенном официальном наборе источников не раскрыто.
- Где хранятся данные: зависит от того, где вы запускаете бинарники или контейнер; общей политики хранения в предоставленных источниках нет.
- Privacy Policy: для самого репозитория llama.cpp в предоставленном наборе источников отдельная privacy policy не дана.
Редакционное ограничение: этот блок — практическая интерпретация официальных install/build/docker-материалов, а не юридическое заключение. Если для вас критичны retention, телеметрия или договорные гарантии, одной только официальной документации из этого набора недостаточно.
Плюсы и минусы
Плюсы
- MIT-лицензия подтверждена в README.
- Несколько официальных путей старта: llama.app, Docker, релизные бинарники и сборка из исходников.
- Есть официальный server mode и примеры проверки через CLI прямо в README.
- Официальные каналы pre-built установки включают conda-forge, Winget, Homebrew, MacPorts и Nix.
Минусы
- Сборка из исходников требует toolchain и backend-specific зависимостей; единый «один клик для всех» здесь не обещан.
- GPU Docker images официально помечены как не полностью CI-tested beyond builds; под точные версии CUDA/ROCm/MUSA может понадобиться локальная пересборка.
- Доступность пакетов и контейнеров может отставать от самого свежего релиза; это прямо отмечено как риск в uncertainty-блоке источников.
- В проверенном наборе источников нет отдельной privacy policy или полной матрицы региональной доступности.
Доступность и язык
Полной единой матрицы совместимости по ОС и регионам в предоставленном наборе источников нет, поэтому ниже — только то, что можно осторожно опереть на официальные install- и docker-документы.
- Платформы и каналы: официально перечислены conda-forge, Winget, Homebrew, MacPorts, Nix и Docker. Это косвенно покрывает типичные сценарии для Windows, macOS и Unix-like окружений, но точную комбинацию «ОС + backend + accelerator» лучше перепроверять в документации перед установкой.
- Русский язык: в проверенных официальных источниках русский интерфейс или русская локализация не заявлены; документация и примеры — на английском.
- Доступность для РФ: в предоставленных официальных источниках нет отдельного статуса «работает без VPN / нужен VPN / заблокирована оплата». Региональную доступность llama.app и любых сопутствующих каналов нужно проверять вручную на момент использования.
- Способы оплаты: в проверенных официальных источниках не указаны, потому что коммерческих тарифов самого llama.cpp здесь не опубликовано.
Альтернативы
Прямых внутренних карточек про другие runtime-движки в подтверждённом наборе ссылок мало, поэтому список ниже намеренно короткий и смешивает прямую замену с материалами для выбора стека.
- Ollama — более готовый локальный раннер для LLM через CLI и API, если вам важен быстрый старт и меньше ручной сборки.
- Llama (Meta AI) — полезно, если вы ещё выбираете само семейство моделей, а не только runtime для их запуска.
- Llama vs Mistral — пригодится, если ваш главный вопрос не «чем запускать», а «какие модели вообще стоит self-hostить».
Для смежных задач могут пригодиться материалы про MCP и LoRA. Важно: текущий официальный набор источников по llama.cpp не подтверждает встроенную поддержку этих вещей, поэтому воспринимайте ссылки как контекст для архитектуры, а не как список нативных функций продукта.
Источники
Вопросы и ответы
Можно ли использовать llama.cpp без сборки из исходников?
Да. В README официально перечислены четыре quick-start пути: llama.app, Docker, готовые бинарники из Releases и сборка из исходников.
Есть ли у llama.cpp серверный режим?
Да. В README есть пример команды llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF.
Сколько стоит llama.cpp?
В проверенном наборе официальных источников коммерческие тарифы самого llama.cpp не опубликованы. Проект описан как MIT-licensed, но pricing page для него в этом наборе нет.
Обязательно ли использовать Docker?
Нет. Docker — только один из официальных способов запуска. Альтернативы из того же источника: сборка из исходников, релизные бинарники и llama.app.
Можно ли считать privacy-политику полностью понятной?
Нет, не по этому набору материалов. Для самого репозитория отдельная privacy policy в предоставленных источниках не дана, поэтому чувствительные сценарии лучше дополнительно проверять организационно и юридически.