COMRAD404 / TOOL

llama.cpp — inference-движок для локального запуска LLM

llama.cpp — MIT-licensed проект ggml-org для inference LLM на C/C++. В карточке: способы установки, пример запуска через CLI и server, ограничения Docker/GPU, приватность и когда лучше взять Ollama.

TOOL

MIT-licensed runtime для локального inference LLM: гибко, но требует внимания к сборке и каналам установки.

PRICE

Build from source | Официальная цена не указана | Максимальный контроль и кастомные backend-ы, но нужны toolchain и platform-specific зависимости.
Pre-built release binaries | Официальная цена не указана | Самый быстрый старт без компиляции, но состав assets зависит от релиза и платформы.
Docker images | Официальная цена не указана | Подходит для воспроизводимого деплоя и server usage; GPU-образы могут потребовать локальную пересборку и не полностью CI-tested beyond builds.
llama.app | Официальная цена не указана | Официальная точка входа для guided bootstrap; поддержку региона и ОС нужно проверять на момент использования.

RU

В предоставленных официальных источниках нет отдельного статуса по РФ. Региональную доступность llama.app и любых сопутствующих каналов нужно проверять вручную; коммерческих тарифов и способов оплаты самого llama.cpp в проверенном наборе не опубликовано.

✅ Подходит: разработчикам и infra-инженерам, которым нужен локальный или self-hosted inference для LLM с контролем над сборкой, backend-ами и способом деплоя. ❌ Не подходит: тем, кто ищет готовый SaaS с тарифами, SLA, GUI по умолчанию и полностью описанной privacy policy. 💡 Ключевое преимущество: у llama.cpp есть несколько официальных путей старта: llama.app, Docker, готовые бинарники из Releases и сборка из исходников.

Практический вердикт: если вы готовы работать с CLI, CMake и контейнерами, llama.cpp выглядит как сильная базовая прослойка для локального inference. Если вам нужен более простой старт без ручной сборки, сначала сравните его с Ollama.

  • Разработчик: ggml-org
  • Тип: self-hosted / CLI / server / Docker / сборка из исходников
  • Официальный URL: llama.app; код и README — ggml-org/llama.cpp
  • Лицензия: MIT
  • Текущий релиз по GitHub Releases: b10405 от 2026-08-13 07:32
  • Дата проверки: 2026-08-13

Что умеет

  • Запускать inference LLM на базе проекта ggml-org в C/C++.
  • Работать через CLI: в README приведён пример проверки с llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF.
  • Поднимать серверный режим: в README есть пример llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF.
  • Собираться из исходников через CMake: официальный путь начинается с git clone, затем cmake -B build и cmake --build build --config Release.
  • Ставиться через готовые каналы установки: conda-forge, Winget, Homebrew, MacPorts и Nix.
  • Запускаться в контейнерах: официальная документация перечисляет семейства образов full, light, server и GPU/backend-specific variants.

Как использовать

Ниже — базовый workflow для разработчика, который хочет сначала собрать llama.cpp из исходников, а затем проверить CLI и server mode. Это воспроизводимый путь из официальных документов, но зависимости и backend-настройки зависят от вашей платформы и ускорителя.

  1. Склонируйте репозиторий.
    git clone https://github.com/ggml-org/llama.cpp
  2. Соберите проект.
    cmake -B build
    cmake --build build --config Release
  3. Проверьте CLI на модели из примера README.
    llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF

    Если вам нужен именно локальный API/сервер, используйте второй официальный пример:

    llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF
  4. Если собираете вариант с Vulkan, отдельно проверьте GPU.
    ./build/bin/llama-cli -m "PATH_TO_MODEL" -p "Hi you how are you" -ngl 99

    Официальная документация пишет, что в ожидаемом выводе должно появиться сообщение о том, что ggml_vulkan обнаружил ваш GPU.

Если сборка из исходников вам не подходит, официальный quick start также допускает три другие ветки: готовые релизные бинарники, Docker и llama.app.

Тарифы и ограничения

У llama.cpp в проверенном наборе официальных источников нет коммерческих тарифных планов в формате SaaS. Это MIT-licensed проект; вместо «планов» есть разные каналы установки и разные операционные ограничения.

Вариант Цена Лимиты и ограничения
Build from source Официальная цена не указана Требуется рабочий toolchain и backend-specific зависимости; шаги зависят от платформы и ускорителя.
Pre-built release binaries Официальная цена не указана Assets зависят от релиза и платформы; состав загрузок меняется по мере публикации новых релизов.
Docker images Официальная цена не указана Нужен Docker; для GPU-образов официальная документация предупреждает, что они не полностью CI-tested beyond builds и иногда требуют локальной пересборки под точные версии CUDA/ROCm/MUSA.
llama.app Официальная цена не указана Перед использованием нужно отдельно проверить поддержку вашей ОС, региона и поведение bootstrap-скрипта на момент установки.

Дата проверки: 2026-08-13. Текущий релиз на GitHub Releases: b10405 от 2026-08-13 07:32.

Ограничение карточки: в предоставленном официальном наборе источников нет pricing page самого llama.cpp, поэтому здесь нельзя честно указать цены, лимиты запросов или способы оплаты как у коммерческого сервиса.

Работа с данными и приватность

По устройству инструмента, показанному в README, build- и docker-документации, вы запускаете локальные бинарники или контейнеры и сами передаёте им модель и входные данные. На практике это означает, что llama.cpp видит те промпты, модели и параметры запуска, которые вы подаёте в CLI или server mode.

  • Что получает инструмент: модель, текст запроса и параметры запуска, которые вы передаёте локальным бинарникам или контейнеру.
  • Использование данных для обучения: в проверенном официальном наборе источников не раскрыто.
  • Где хранятся данные: зависит от того, где вы запускаете бинарники или контейнер; общей политики хранения в предоставленных источниках нет.
  • Privacy Policy: для самого репозитория llama.cpp в предоставленном наборе источников отдельная privacy policy не дана.

Редакционное ограничение: этот блок — практическая интерпретация официальных install/build/docker-материалов, а не юридическое заключение. Если для вас критичны retention, телеметрия или договорные гарантии, одной только официальной документации из этого набора недостаточно.

Плюсы и минусы

Плюсы

  • MIT-лицензия подтверждена в README.
  • Несколько официальных путей старта: llama.app, Docker, релизные бинарники и сборка из исходников.
  • Есть официальный server mode и примеры проверки через CLI прямо в README.
  • Официальные каналы pre-built установки включают conda-forge, Winget, Homebrew, MacPorts и Nix.

Минусы

  • Сборка из исходников требует toolchain и backend-specific зависимостей; единый «один клик для всех» здесь не обещан.
  • GPU Docker images официально помечены как не полностью CI-tested beyond builds; под точные версии CUDA/ROCm/MUSA может понадобиться локальная пересборка.
  • Доступность пакетов и контейнеров может отставать от самого свежего релиза; это прямо отмечено как риск в uncertainty-блоке источников.
  • В проверенном наборе источников нет отдельной privacy policy или полной матрицы региональной доступности.

Доступность и язык

Полной единой матрицы совместимости по ОС и регионам в предоставленном наборе источников нет, поэтому ниже — только то, что можно осторожно опереть на официальные install- и docker-документы.

  • Платформы и каналы: официально перечислены conda-forge, Winget, Homebrew, MacPorts, Nix и Docker. Это косвенно покрывает типичные сценарии для Windows, macOS и Unix-like окружений, но точную комбинацию «ОС + backend + accelerator» лучше перепроверять в документации перед установкой.
  • Русский язык: в проверенных официальных источниках русский интерфейс или русская локализация не заявлены; документация и примеры — на английском.
  • Доступность для РФ: в предоставленных официальных источниках нет отдельного статуса «работает без VPN / нужен VPN / заблокирована оплата». Региональную доступность llama.app и любых сопутствующих каналов нужно проверять вручную на момент использования.
  • Способы оплаты: в проверенных официальных источниках не указаны, потому что коммерческих тарифов самого llama.cpp здесь не опубликовано.

Альтернативы

Прямых внутренних карточек про другие runtime-движки в подтверждённом наборе ссылок мало, поэтому список ниже намеренно короткий и смешивает прямую замену с материалами для выбора стека.

  • Ollama — более готовый локальный раннер для LLM через CLI и API, если вам важен быстрый старт и меньше ручной сборки.
  • Llama (Meta AI) — полезно, если вы ещё выбираете само семейство моделей, а не только runtime для их запуска.
  • Llama vs Mistral — пригодится, если ваш главный вопрос не «чем запускать», а «какие модели вообще стоит self-hostить».

Для смежных задач могут пригодиться материалы про MCP и LoRA. Важно: текущий официальный набор источников по llama.cpp не подтверждает встроенную поддержку этих вещей, поэтому воспринимайте ссылки как контекст для архитектуры, а не как список нативных функций продукта.

Источники

Вопросы и ответы

Можно ли использовать llama.cpp без сборки из исходников?

Да. В README официально перечислены четыре quick-start пути: llama.app, Docker, готовые бинарники из Releases и сборка из исходников.

Есть ли у llama.cpp серверный режим?

Да. В README есть пример команды llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF.

Сколько стоит llama.cpp?

В проверенном наборе официальных источников коммерческие тарифы самого llama.cpp не опубликованы. Проект описан как MIT-licensed, но pricing page для него в этом наборе нет.

Обязательно ли использовать Docker?

Нет. Docker — только один из официальных способов запуска. Альтернативы из того же источника: сборка из исходников, релизные бинарники и llama.app.

Можно ли считать privacy-политику полностью понятной?

Нет, не по этому набору материалов. Для самого репозитория отдельная privacy policy в предоставленных источниках не дана, поэтому чувствительные сценарии лучше дополнительно проверять организационно и юридически.

Плюсы

  • MIT-лицензия подтверждена в README.
  • Есть несколько официальных путей старта: llama.app, Docker, релизные бинарники и сборка из исходников.
  • В README есть примеры для CLI и server mode.
  • Официальные pre-built каналы установки включают conda-forge, Winget, Homebrew, MacPorts и Nix.

Минусы

  • Сборка из исходников требует toolchain и backend-specific зависимостей.
  • GPU Docker images официально не полностью CI-tested beyond builds и иногда требуют локальной пересборки под точные версии backend-ов.
  • Доступность пакетов и контейнеров может отставать от самого свежего релиза; это нужно перепроверять перед установкой.
  • В проверенном наборе источников нет отдельной privacy policy или полной матрицы региональной доступности.

Источники

SOURCES

Вопросы и ответы

FAQ
Можно ли использовать llama.cpp без сборки из исходников?

Да. В README официально перечислены четыре quick-start пути: llama.app, Docker, готовые бинарники из Releases и сборка из исходников.

Есть ли у llama.cpp серверный режим?

Да. В README есть пример команды llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF.

Сколько стоит llama.cpp?

В проверенном наборе официальных источников коммерческие тарифы самого llama.cpp не опубликованы. Проект описан как MIT-licensed, но pricing page для него в этом наборе нет.

Обязательно ли использовать Docker?

Нет. Docker — только один из официальных способов запуска. Альтернативы из того же источника: сборка из исходников, релизные бинарники и llama.app.

Можно ли считать privacy-политику полностью понятной?

Нет, не по этому набору материалов. Для самого репозитория отдельная privacy policy в предоставленных источниках не дана, поэтому чувствительные сценарии лучше дополнительно проверять организационно и юридически.

Читайте также

LINKS