NVIDIA представила Kumo Tabular — открытую фундаментальную модель для табличных данных, работающую без дообучения

NVIDIA выпустила Kumo Tabular — серию открытых моделей для классификации и регрессии на таблицах, которые предсказывают метки за один прямой проход без тренировки, настройки признаков и подбора гиперпараметров. Модель доступна на Hugging Face и GitHub под коммерческой лицензией OpenMDW-1.1.

Диаграмма архитектуры NVIDIA Kumo Tabular, показывающая обработку табличных данных через cell embedding, row embedding и in-context learning
Диаграмма архитектуры NVIDIA Kumo Tabular, показывающая обработку табличных данных через cell embedding, row embedding и in-context learning
Изображение из исходного материала

29 сентября 2026 года NVIDIA опубликовала на Hugging Face открытую фундаментальную модель Kumo Tabular, предназначенную для работы с табличными данными. Модель способна выполнять классификацию и регрессию за один прямой проход, не требуя дообучения, инженерии признаков или подбора гиперпараметров. Kumo Tabular доступна в трёх размерах: Small (28M параметров), Medium (100M) и Large (215M), и распространяется под лицензией OpenMDW-1.1, разрешающей коммерческое использование.

Как устроена Kumo Tabular

Kumo Tabular — это Transformer, построенный вокруг структуры таблицы. В основе лежат механизмы внимания, впервые реализованные в подходах TabICL и TabPFN. Модель решает три задачи: понимает значение каждого значения внутри своей колонки, определяет взаимодействие колонок внутри строки и связывает строки контекста (с известными метками) со строками запроса (без меток).

Архитектура включает три ключевых этапа:

Cell Embedding. Группа ячеек превращается в токен. Числовые и категориальные значения проходят через преобразование Фурье (синусы и косинусы изученных частот) с отдельными весами для каждого типа. Пропущенные значения не требуют импутации — модель обрабатывает их особым образом. Каждый токен контекста получает эмбеддинг метки.

Row Embedding. Каждая строка превращается в эмбеддинг через чередование двух типов внимания. Column attention анализирует одну колонку, определяя, является ли значение типичным или экстремальным для своего распределения. Row attention смотрит на токены одной строки, изучая взаимодействие признаков. Четыре обучаемых токена [CLS] присоединяются к каждой строке и служат финальным считывателем.

In-Context Learning. Финальный Transformer работает с эмбеддингами строк. Строки контекста взаимодействуют друг с другом, а строки запроса — только со строками контекста. Это означает, что предсказание для каждой строки зависит только от контекста и самой строки, а не от того, какие ещё строки оцениваются одновременно.

Особое внимание уделено проблеме «размывания» внимания при росте числа строк. Kumo Tabular использует length-aware attention temperature — температуру, которая растёт логарифмически с числом ключей, сохраняя резкость внимания на таблицах с десятками тысяч строк.

Обучение на синтетических данных

Kumo Tabular обучается исключительно на искусственных таблицах, генерируемых процедурным сэмплером. Каждая таблица создаётся через Structural Causal Model (SCM) в шесть шагов: выбирается конфигурация (размер, задача, механизмы), строится случайный каузальный граф, узлы вычисляются через случайные функции (линейные отображения, нейросети, деревья, гауссовы процессы), часть узлов становится колонками, один — целевой переменной, остальные остаются скрытыми. Постобработка добавляет корреляции групп колонок, обрезает выбросы и вносит пропуски. Быстрая проверка через ансамбль деревьев отбрасывает таблицы без обучаемого сигнала.

Такой подход позволяет генерировать бесконечное разнообразие таблиц с новыми графами и механизмами. При этом генератор включает реалистичные несовершенства: пропуски разных паттернов, огрубление признаков (когда дубликаты строк могут иметь разные метки), категориальные колонки с большим числом уровней и тяжелохвостые распределения для регрессии. Модель, обученная на миллионах таких таблиц, учится обрабатывать эти несовершенства без предварительной очистки.

Обучение проходит в три этапа: первый — на таблицах из 1024 строк и до 100 колонок, второй — с варьированием контекста от 400 до 10240 строк, третий — до 60000 строк. Классификация и регрессия обучаются как отдельные модели.

Бенчмарки и позиционирование

NVIDIA заявляет, что Kumo Tabular занимает первое место на четырёх бенчмарках: TabArena, BeyondArena, TALENT и ScoringBench. В блоге компании подчёркивается, что модель превосходит градиентный бустинг (XGBoost, LightGBM, CatBoost) — стандарт индустрии для табличных данных на протяжении двух десятилетий — без необходимости в инженерии признаков и подборе гиперпараметров.

Kumo Tabular входит в коллекцию NVIDIA Kumo Structured model collection. Исходный код и библиотека для инференса доступны на GitHub.

Что это меняет для разработчиков

Для команд, работающих с табличными данными, Kumo Tabular предлагает альтернативу традиционному пайплайну: сбор меток → инженерия признаков → поиск гиперпараметров → валидация → деплой. Модель позволяет получить предсказание за один прямой проход, передав таблицу с размеченными строками и строками для предсказания.

Практическая ценность: снижение порога входа для задач, где раньше требовался опытный ML-инженер для настройки градиентного бустинга. Однако стоит учитывать, что модель обучена на синтетических данных, и её поведение на реальных таблицах с уникальными распределениями, не представленными в обучении, может отличаться. Компания не публиковала независимых валидаций результатов бенчмарков сторонними исследователями.

Контекст: NVIDIA и табличные модели

Релиз Kumo Tabular — часть более широкой стратегии NVIDIA по созданию фундаментальных моделей для структурированных данных. Ранее компания выпустила AI-Q — открытый блюпринт для агентов глубокого исследования, занявший первое место на DeepResearch Bench I и II. Выход Kumo Tabular расширяет портфель открытых моделей NVIDIA в направлении, которое традиционно считалось прерогативой градиентного бустинга и более тяжёлых подходов.

Следует отметить, что область фундаментальных моделей для таблиц активно развивается: ранее были представлены TabPFN, TabICL и их версии. Kumo Tabular отличается размером (до 215M параметров), поддержкой контекста до 60000 строк и коммерческой лицензией.

Ограничения и что стоит проверить

На данный момент результаты бенчмарков предоставлены самой NVIDIA. Независимые тесты на реальных датасетах, особенно с нестандартными распределениями, тяжёлыми хвостами или специфическими пропусками, пока не опубликованы. Разработчикам, рассматривающим Kumo Tabular для продакшна, стоит провести собственное A/B-тестирование на своих данных, сравнив с градиентным бустингом и другими табличными моделями.

Модель доступна для загрузки и тестирования через библиотеку на GitHub и на странице Hugging Face. Лицензия OpenMDW-1.1 разрешает коммерческое использование, что снижает юридические риски для enterprise-внедрений.

Источники