COMRAD404 / TOOL

TGI (Text Generation Inference, HF) — сервер инференса LLM от Hugging Face

TGI — сервер инференса LLM от Hugging Face. На 14.08.2026 он в maintenance mode, а репозиторий архивирован. Ниже — что умеет TGI, как его запускать, как устроены hosted/self-hosted варианты и когда разумнее смотреть на vLLM или SGLang.

TOOL

Сервер инференса LLM от Hugging Face в режиме maintenance: полезен для поддержки существующих TGI-стеков, но для новых развёртываний стоит сначала проверить vLLM и SGLang.

PRICE

Self-hosted TGI через Docker | Без прямой цены за ПО; инфраструктура оплачивается отдельно | Официальный quick start показывает Docker-запуск и проверку API. Точный тег образа лучше перепроверять по странице релизов.
Self-hosted TGI через CLI | Без прямой цены за ПО; инфраструктура оплачивается отдельно | CLI официально покрывает загрузку весов, квантизацию, запуск сервера и просмотр опций через text-generation-launcher --help.
Hugging Face Inference Endpoints (engine: TGI) | Pay-as-you-go; точная цена зависит от выбранного compute и условий биллинга | Нужны активный аккаунт Hugging Face и способ оплаты; engine TGI в maintenance mode; для смены engine создаётся новый endpoint.

RU

По РФ в просмотренных официальных материалах нет отдельной матрицы регионов для TGI. Для hosted Inference Endpoints нужны аккаунт Hugging Face и способ оплаты; фактическую доступность и регионы нужно проверять в интерфейсе продукта и на официальных страницах pricing/access.

✅ Подходит: командам, которые уже используют TGI или хотят быстро проверить существующий Hugging Face-совместимый стек через Docker, CLI и API. ❌ Не подходит: тем, кто выбирает движок для нового production-развёртывания и рассчитывает на активное развитие именно TGI. 💡 Ключевое преимущество: официальная документация Hugging Face всё ещё покрывает запуск, CLI, поддерживаемые модели и hosted-сценарий через Inference Endpoints.

TGI (Text Generation Inference) у Hugging Face на дату проверки 14.08.2026 находится в maintenance mode. Официальные документы прямо рекомендуют для новых развёртываний смотреть в сторону vLLM и SGLang, а исходный репозиторий huggingface/text-generation-inference архивирован владельцем и доступен только для чтения.

Разработчик: Hugging Face. Тип: self-hosted / API / engine для Hugging Face Inference Endpoints. Официальный URL: huggingface.co/docs/text-generation-inference/index. Дата проверки: 14.08.2026. Последний релиз по GitHub: v3.3.7 от 19.12.2025. Статус репозитория: archived/read-only с 21.03.2026.

Практический вердикт: если вы запускаете новый стек LLM-inference с нуля, начинать оценку лучше не с TGI, а с альтернатив, которые сама Hugging Face рекомендует для новых deployment-сценариев. TGI имеет смысл прежде всего там, где у вас уже есть рабочая совместимость, внутренняя обвязка или инфраструктура под этот сервер.

Что умеет

  • Разворачивать и обслуживать большие языковые модели как отдельный сервер инференса.
  • Запускаться из Docker-образа; в официальном quick start показан запуск с публикацией порта 8080.
  • Проверяться через Messages API по пути /v1/chat/completions и через streaming endpoint.
  • Показывать локальную документацию и Swagger UI через /docs для быстрой проверки API после старта сервера.
  • Работать через CLI: скачивание весов, квантизация модели, запуск сервера и просмотр доступных опций через text-generation-launcher --help.
  • Поддерживать многие семейства моделей, включая Llama, Gemma, Qwen, Mistral, DeepSeek, Mixtral, Phi и другие; часть неподдерживаемых моделей может работать в режиме best-effort через Transformers auto-model classes.

Если вы сравниваете такие серверы, полезно понимать термины batching и throughput. Редакционное ограничение: в предоставленном официальном пакете по TGI нет единой сравнительной таблицы производительности, поэтому реальные замеры под вашу модель и нагрузку придётся проверять отдельно.

Как использовать

Ниже — воспроизводимый базовый workflow без выдуманных команд и тегов образов. Он опирается только на то, что подтверждено официальной документацией Hugging Face и страницей релизов.

  1. Выберите модель. Сначала сверяете семейство модели со списком поддерживаемых. Если нужной модели там нет, источник прямо предупреждает: возможен только режим best-effort через Transformers auto-model classes.
  2. Выберите способ запуска. Для быстрого старта используете Docker-сценарий из официальной документации. Если нужен более детальный контроль, берёте CLI-путь, где документированы загрузка весов, квантизация и запуск сервера.
  3. Перед запуском перепроверьте релиз. Поскольку README и quick start могут отставать от страницы релизов, точный тег Docker-образа и состояние ветки разумно сверить с GitHub Releases. На дату проверки последним релизом указан v3.3.7.
  4. Проверьте доступность API. После старта сервера открываете /docs и Swagger UI, затем отправляете тестовый запрос на /v1/chat/completions или используете streaming endpoint. Это самый быстрый способ убедиться, что сервер отвечает корректно.
  5. Если нужен managed-hosting, создайте отдельный endpoint. В Hugging Face Inference Endpoints TGI доступен как engine, но документация отдельно предупреждает: чтобы сменить engine, нельзя просто отредактировать существующий endpoint — нужно создать новый.

Для действующей инфраструктуры этого достаточно, чтобы подтвердить базовую работоспособность. Для нового проекта этого workflow уже недостаточно: придётся параллельно сравнить TGI с vLLM и SGLang, потому что сама Hugging Face рекомендует их как более актуальный стартовый выбор.

Тарифы и ограничения

У самого open-source TGI в просмотренных источниках нет фиксированной «цены лицензии». Но hosted-сценарий через Hugging Face Inference Endpoints оплачивается отдельно, по модели pay-as-you-go, и точная стоимость зависит от выбранного compute и условий биллинга.

План Цена Лимиты
Self-hosted TGI через Docker Без прямой цены за ПО; инфраструктура оплачивается отдельно Нужны собственные ресурсы и самостоятельная проверка точного тега образа по странице релизов перед развёртыванием
Self-hosted TGI через CLI Без прямой цены за ПО; инфраструктура оплачивается отдельно CLI официально покрывает загрузку весов, квантизацию, запуск сервера и просмотр опций, но не снимает с вас ответственность за собственную инфраструктуру
Hugging Face Inference Endpoints (engine: TGI) Pay-as-you-go; точная цена зависит от выбранного compute и условий биллинга Нужны активный аккаунт Hugging Face и способ оплаты; engine TGI находится в maintenance mode; для смены engine создаётся новый endpoint

Проверено: 14.08.2026.

Редакционное ограничение: в предоставленном официальном пакете нет фиксированной таблицы цен по всем регионам и инстансам, поэтому здесь сознательно не приведены числа. Для hosted-развёртывания их нужно проверять на официальной странице pricing в момент покупки.

Работа с данными и приватность

У TGI вопрос приватности сильно зависит от способа развёртывания. Сам инструмент — это сервер инференса; поэтому базовый ответ такой: он обрабатывает те запросы, которые вы ему отправляете, и работает с теми весами модели, которые вы загружаете или подключаете.

  • Что видит сервис: в self-hosted-сценарии ваш сервер TGI получает входящие API-запросы и отдаёт ответы через документированные endpoint-ы вроде /v1/chat/completions. В hosted-сценарии эти запросы проходят через Hugging Face Inference Endpoints.
  • Использование данных для обучения: в просмотренных официальных материалах по самому TGI и странице engine для Inference Endpoints нет явного, отдельного утверждения в формате «да/нет/опционально» именно для этого инструмента. Поэтому честный статус здесь — не раскрыто в предоставленном пакете.
  • Где хранятся данные: в предоставленных источниках нет TGI-специфичной матрицы регионов или отдельного описания хранения данных по регионам. Для hosted-варианта географию и регион нужно проверять в интерфейсе продукта и связанных страницах Hugging Face.
  • Политика приватности: в supplied source pack нет отдельной страницы Privacy Policy именно для TGI, поэтому я не добавляю сюда не проверенную ссылку.

Практический вывод: если для вас критичны резидентность данных, договорные условия и формальный privacy review, TGI как open-source сервер нужно оценивать вместе с выбранной вами инфраструктурой, а hosted Inference Endpoints — отдельно, уже по актуальным юридическим документам и региональным настройкам в продукте. В рамках этого обзора такой проверки недостаточно.

Плюсы и минусы

Плюсы

  • Есть официальная документация по Docker, CLI, API-проверке через /docs и Messages API — порог первого запуска относительно понятный.
  • Поддерживается много известных семейств моделей, а для части неподдерживаемых сценариев есть best-effort fallback через Transformers auto-model classes.
  • TGI можно использовать и как self-hosted сервер, и как engine в Hugging Face Inference Endpoints.
  • Состояние проекта хорошо читается по источникам: есть зафиксированный последний релиз v3.3.7, поэтому существующий стек проще «заморозить» и сопровождать без сюрпризов активной смены направления.

Минусы

  • TGI находится в maintenance mode; для новых deployment-сценариев сама Hugging Face рекомендует смотреть на vLLM и SGLang.
  • Основной GitHub-репозиторий архивирован и переведён в read-only, то есть рассчитывать на обычный темп развития этого репо уже не стоит.
  • Для hosted-варианта нет одной фиксированной цены: стоимость зависит от выбранного compute и биллинга, поэтому планирование бюджета сложнее без ручной проверки.
  • Сменить engine у существующего Inference Endpoint нельзя простым редактированием: требуется создать новый endpoint.
  • В просмотренных материалах нет отдельной TGI-матрицы по регионам и нет достаточно подробного privacy-пакета именно для этой карточки, поэтому часть enterprise-вопросов придётся добирать вне этого обзора.

Доступность и язык

  • Платформы: официально подтверждены Docker-развёртывание, CLI-сценарий и managed-вариант через Hugging Face Inference Endpoints. Отдельной матрицы Windows/macOS/Linux в просмотренных материалах нет.
  • Русский язык: официальная документация, которую удалось проверить, англоязычная. Подтверждения русского интерфейса TGI в source pack нет.
  • Доступность для РФ: в официальных материалах, просмотренных для этой карточки, нет отдельной TGI-специфичной региональной матрицы. Для hosted-доступа фактические регионы и возможность развёртывания нужно проверять в интерфейсе Hugging Face Inference Endpoints и на связанных страницах pricing/access.
  • Оплата: для hosted Inference Endpoints нужны активный аккаунт Hugging Face и способ оплаты. Более точные методы оплаты в предоставленном пакете не перечислены.
  • Вывод по доступности: если вам нужен гарантированный ответ именно по РФ без дополнительных проверок, этого пакета источников недостаточно.

Альтернативы

Список здесь намеренно короткий и опирается только на то, что прямо присутствует в официальных материалах Hugging Face по TGI.

  • vLLM — первая альтернатива, которую Hugging Face рекомендует для новых deployment-сценариев вместо TGI.
  • SGLang — вторая официально рекомендованная альтернатива для новых развёртываний вместо TGI.
  • Hugging Face Inference Endpoints с другим engine — если вам нужен managed-hosting, а не self-hosted TGI, логично сразу выбирать более актуальный engine при создании нового endpoint; обратите внимание, что смена engine у уже существующего endpoint требует создания нового.

Ограничение раздела: в supplied source pack нет более широкой, официально подтверждённой матрицы конкурентов с ценами и совместимостью, поэтому искусственно расширять список альтернатив я не буду.

Источники

Вопросы и ответы

Подходит ли TGI для нового production-проекта?

Скорее нет, если вы начинаете с нуля. Официальная документация Hugging Face помечает TGI как maintenance mode и рекомендует для новых развёртываний vLLM и SGLang.

Можно ли запустить TGI через Docker?

Да. Официальный quick start показывает запуск из Docker-образа, публикацию порта 8080 и последующую проверку сервера через /v1/chat/completions, streaming endpoint и /docs.

Какая последняя версия указана в официальных источниках?

На странице GitHub Releases последним релизом указан v3.3.7 от 19.12.2025. При этом сам репозиторий архивирован и находится в read-only с 21.03.2026.

Есть ли у TGI фиксированная цена?

Для open-source TGI в просмотренных материалах нет фиксированной цены за само ПО. Hosted-вариант через Hugging Face Inference Endpoints оплачивается по модели pay-as-you-go, а точная сумма зависит от выбранного compute и условий биллинга.

Можно ли у существующего Hugging Face endpoint просто сменить engine с TGI на другой?

Нет. На странице TGI для Inference Endpoints прямо указано, что смена engine требует создания нового endpoint, а не редактирования существующего.

Плюсы

  • Есть официальная документация по Docker, CLI, /docs и /v1/chat/completions, поэтому базовый запуск и проверка сервера прозрачны.
  • Поддерживается много семейств моделей, включая Llama, Gemma, Qwen, Mistral, DeepSeek, Mixtral и Phi; часть неподдерживаемых моделей может работать best-effort.
  • Доступны и self-hosted, и managed-сценарии через Hugging Face Inference Endpoints.
  • Последний релиз и статус проекта легко верифицируются по официальным источникам, что удобно для сопровождения уже существующего стека.

Минусы

  • TGI находится в maintenance mode, а Hugging Face рекомендует vLLM и SGLang для новых развёртываний.
  • Основной GitHub-репозиторий архивирован и переведён в read-only с 21.03.2026.
  • У hosted-варианта нет одной фиксированной цены: стоимость зависит от compute и биллинга.
  • Сменить engine у существующего Inference Endpoint нельзя без создания нового endpoint.
  • В просмотренных источниках нет полной TGI-специфичной матрицы по регионам и отдельной privacy-страницы именно для этой карточки.

Источники

SOURCES

Вопросы и ответы

FAQ
Подходит ли TGI для нового production-проекта?

Скорее нет, если вы начинаете с нуля. Официальная документация Hugging Face помечает TGI как maintenance mode и рекомендует для новых развёртываний vLLM и SGLang.

Можно ли запустить TGI через Docker?

Да. Официальный quick start показывает запуск из Docker-образа, публикацию порта 8080 и проверку через /v1/chat/completions, streaming endpoint и /docs.

Какая последняя версия указана в официальных источниках?

На странице GitHub Releases последним релизом указан v3.3.7 от 19.12.2025. Сам репозиторий архивирован и находится в read-only с 21.03.2026.

Есть ли у TGI фиксированная цена?

Для open-source TGI в просмотренных материалах нет фиксированной цены за само ПО. Hosted-вариант через Hugging Face Inference Endpoints оплачивается по модели pay-as-you-go, а точная сумма зависит от выбранного compute и условий биллинга.

Можно ли у существующего Hugging Face endpoint просто сменить engine с TGI на другой?

Нет. На странице TGI для Inference Endpoints указано, что смена engine требует создания нового endpoint, а не редактирования существующего.

Читайте также

LINKS