
Исследовательская группа из UC Berkeley и UT Austin представила FreeToken — открытый edge-native движок обслуживания Mixture-of-Experts (MoE) моделей, который решает проблему запуска тяжелых языковых моделей на потребительском и рабочем «железе». Релиз распространяется под лицензией Apache-2.0 на GitHub и доступен в виде пакета PyPI.
Современные открытые модели, такие как Kimi-K3, GLM-5.2 и DeepSeek-V4-Flash, догнали проприетарные аналоги по ключевым метрикам, однако требования к их инфраструктуре остаются барьером для разработчиков. Традиционные бэкенды рассчитаны на кластеры датацентров, тогда как FreeToken рассматривает персональную или рабочую машину как единую эластичную платформу инференса, динамически распределяя нагрузку между GPU, центральным процессором и системной шиной.
Архитектура распределения памяти и вычислений
Особенность движка заключается в подходе к работе с разреженными моделями (MoE). Например, DeepSeek-V4-Flash активирует лишь 6 из 256 маршрутизируемых экспертов на каждый из 43 слоев, задействуя около 13 миллиардов параметров из общих 284 миллиардов для одного токена. В то же время полный объем неактивных экспертов в формате FP4 занимает сотни гигабайт.
Существующие движки вроде llama.cpp, KTransformers и Ollama часто упираются в узкие места при обработке промахов кэша экспертов (cache misses) на PCIe-шине. FreeToken разделяет эти промахи между загрузкой по шине PCIe и вычислениями на CPU, используя измеренную пропускную способность конкретного оборудования. Это позволяет минимизировать простои процессора видеокарты при работе со сверхбольшими весами.
Производительность и тесты на оборудовании
В ходе бенчмарков на видеокарте NVIDIA RTX 5090 движок FreeToken продемонстрировал следующие показатели:
– На Qwen3.6-35B-A3B в формате BF16 скорость генерации составила 77–83 токенов в секунду.
– На DeepSeek-V4-Flash (MXFP4) скорость достигает 22–25 токенов в секунду, что в 1.5–2.3 раза превышает базовые открытые решения.
– Время до первого токена (TTFT) во всех тестовых сценариях не превышало 44 секунд, в то время как альтернативные движки в аналогичных условиях демонстрировали задержки до нескольких сотен секунд, приводящие к тайм-аутам агентских клиентов.
На ноутбуке с 8 ГБ видеопамяти RTX 4060 сборка NVFP4 обрабатывает 35B модель со скоростью 39.3 токена в секунду. На одиночной рабочей станции с картой RTX PRO 6000 модель GLM-5.2 с 753 миллиардами параметров (из которых 40 миллиардов активны) выдает 14.9 токена в секунду против 7.3 токена у стандартных сборок llama.cpp.
Ключевые факты
| Параметр | Значение |
| — | — |
| Разработчики | Исследователи UC Berkeley и UT Austin |
| Лицензия и репозиторий | Apache-2.0, доступно на GitHub и PyPI (v0.1.2) |
| Поддерживаемые конфигурации | От 8 ГБ ноутбучных GPU до одиночных рабочих станций с GLM-5.2 |
| Интеграция | Эндпоинты OpenAI / Anthropic, утилита ft launch для Claude Code и Codex |
Практическое применение для разработчиков
Движок поставляется с интерфейсом командной строки под Linux x86_64 с видеокартами NVIDIA (требуется драйвер r580+ и CUDA 13). Команда ft serve поднимает локальный сервер на порту 1919 с поддержкой стандартов OpenAI и Anthropic API, а команда ft launch настраивает прямую работу локальных сред разработки вроде Claude Code, Codex или OpenCode с вашим собственным оборудованием.
Решение ориентировано на соло-разработчиков, стартапы и небольшие инженерные команды, у которых затраты на облачные API токенов превышают стоимость локального железа. В корпоративном сегменте инструмент представляет интерес для работы в изолированных контурах (air-gapped среды), где критически важна конфиденциальность данных — в сфере медицинских, юридических, финансовых и оборонных разработок, когда код и документы не покидают пределы рабочей станции.
Источник: MarkTechPost, https://www.marktechpost.com/2026/08/23/meet-freetoken-an-edge-native-moe-serving-engine-that-runs-753b-glm-5-2-on-a-single-workstation-gpu/
Datos clave
| Punto | Detalle |
|---|---|
| Fuente | MarkTechPost |
| Fecha | 2026-08-23T10:44:59+00:00 |
| Tema | Meet FreeToken: An Edge-Native MoE Serving Engine that Runs 753B GLM-5.2 on a Single Workstation GPU |
