RigMark — бенчмарк локального AI в стиле кодинг-агентов: что это значит для практиков

На GitHub появился RigMark — воспроизводимый серверный бенчмарк от Алекса Эллиса. Он измеряет не сырой токен/с, а поведение локальных моделей при генерации кода, прозы, структурированного вывода и параллельных запросах — именно так, как с ними взаимодействуют реальные агенты.

Интерфейс или логотип бенчмарка RigMark
Интерфейс или логотип бенчмарка RigMark
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-38).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

На GitHub опубликован RigMark — инструмент для тестирования производительности локального AI, созданный под реальную нагрузку кодинг-агентов. Проект представляют не как очередной бенчмарк генерации токенов, а как воспроизводимый серверный тест для всего OpenAI-совместимого стека.

Что такое RigMark и чем он отличается
RigMark измеряет не абстрактный «токен/с», а поведение модели в четырёх чётко обозначенных сценариях. Это генерация прозы в стиле агента, генерация кода, потолок структурированного вывода (с явной разметкой формата ответа) и метрика prefill — точный сброс кеша с немедленным повтором запроса. Добавлен также замер параллельной обработки запросов, что важно при обслуживании нескольких агентов одновременно. Фиксированные входные данные и публикуемые диапазоны результатов дают прослеживаемую «квитанцию» — какая ревизия RigMark, какие веса и какая серверная обвязка использовались.

Почему сырой токен/с — плохой ориентир
Алекс Эллис, автор RigMark, пишет в сопроводительных материалах: цифры вроде «65–80 токен/с» мало что говорят без понимания рабочей нагрузки. Счёт до 200 может выглядеть совсем иначе, чем написание прозы или кода, особенно при включённом спекулятивном декодировании. Проект родился из попытки сопоставить заявления из соцсетей с тем, что реально происходит на собственных GPU автора — в частности, на связке из нескольких DGX Spark. RigMark стал тем инструментом, который позволяет не гадать, а сравнивать apples-to-apples.

Протокол и ограничения
Текущий протокол (1.3) допускает 8 192 сгенерированных токенов на один декодирующий сэмпл, но не претендует на имитацию полной многоходовой сессии кодинг-агента. Создатели чётко разделяют: это серверный бенчмарк, а не симуляция агентного цикла с обратной связью. Модельная агностичность позволяет тестировать Qwen, GLM, DeepSeek, vLLM, SGLang, локальные GPU-серверы или связки DGX Spark по единой методике. Сравнение разных топологий требует идентичных весов и софта — в противном случае это уже сравнение «аппарат + модель», а не чисто серверного ускорения.

Первые отзывы и практическая польза
Инструмент уже применяется авторами рецептов для DGX Spark. Сразу несколько разработчиков отметили, что прогон тестов RigMark не только подтверждает ожидаемую скорость, но и подсвечивает зоны для улучшения. Среди отзывов:
— «keep up your work, rigmark itself is great» — пользователь @O80925253, 30 сентября 2026;
— «I’m definitely going to be keeping Rigmark in the stack for testing. Initial numbers look good…» — @bertholomusai после запуска GLM-5.3 EXL3 на четырёх DGX Spark;
— «but actually running that test pointed out some improvements I missed» — @jayleaton после стандартного набора тестов на TensorFold GLM-5.3-Flash.

Сам Эллис упоминает, что помимо бенчмарков локальному AI нужна управляющая плоскость — и предлагает superterm для кодинга, чата и голосового ввода на собственной инфраструктуре, но это уже смежный продукт. RigMark же фокусируется на методе измерения.

Почему это важно для практиков
Рынок локальных LLM переполнен цифрами, полученными в разных условиях. RigMark даёт единый жёсткий сценарий с разными типами нагрузки, который можно воспроизвести у себя. Это сокращает дистанцию между синтетическими тестами и реальной работой агентов, а заодно документирует конфигурацию, исключая гадание «а на чём это крутилось?».

RigMark доступен на GitHub под открытой лицензией. Проект продолжает развиваться, фиксируя протоколы и расширяя покрытие серверных стеков.

Источники
— Репозиторий RigMark: https://github.com/alexellis/rigmark (основной источник)
— Обсуждение на Hacker News: https://news.ycombinator.com/item?id=49979017