Inkling small — не универсальный лидер, а прагматичный инструмент для тех, кому важны стоимость, скорость и возможность работать с открытыми весами. В срезе COMRAD404 от 31 августа 2026 года модель заняла 28-е место с COMRAD Score 70,0. Её профиль неоднороден: редакционная оценка эффективности достигла 84,4 балла, доступности — 96,4, а человеческого предпочтения — 81,0. При этом качество получило 64,6, а кодирование — только 44,4 балла.
Такое сочетание говорит о конкретной специализации. Inkling small подходит для недорогих ассистентов, мультимодального ввода, суммаризации, классификации, генерации синтетических данных, инструментальных агентов и экспериментов с дообучением. Но если главным критерием является стабильная работа сложного программного агента или максимальная точность на трудных задачах, одного высокого места по эффективности будет недостаточно.
Ниже приведены числа именно из паспорта модели и рейтинга COMRAD404. Они относятся к редакционному срезу на 31 августа 2026 года, а не являются обещанием постоянных характеристик API.
Коротко
- Место: 28-е в редакции COMRAD404 2026 H2.
- COMRAD Score: 70,0 из 100. Это нормализованная редакционная оценка, а не процент правильных ответов.
- Сильные стороны: эффективность 84,4, доступность 96,4, человеческое предпочтение 81,0, низкая цена и высокая скорость вывода.
- Слабые стороны: качество 64,6 и особенно кодирование 44,4; модель не выглядит оптимальным первым выбором для сложных coding-first сценариев.
- Формат: открытые веса, Apache 2.0, reasoning, текстовый, визуальный и аудиоввод с генерацией текста.
- Практический вывод: Inkling small разумно рассматривать как экономичный мультимодальный рабочий слой, а не как безусловную замену более сильным моделям в критичных задачах.
Паспорт модели
| Параметр | Значение | Как это читать |
|---|---|---|
| Модель | Inkling small | В паспорте используется это написание; официальные материалы называют модель Inkling-Small. |
| Разработчик | Thinky | Так указано в переданном паспорте; официальный model card указывает Thinking Machines Lab, Inc. |
| Место в COMRAD404 | 28 | Позиция в редакции 2026 H2 на 31 августа 2026 года. |
| COMRAD Score | 70,0 / 100 | Нормализованная редакционная оценка. |
| Лицензия | Apache 2.0 | Пермиссивная лицензия весов; открытые веса не означают, что весь стек развёртывания поставляется как единый открытый продукт. |
| Open weights | Да | Веса доступны для исследований, интеграции и дообучения с учётом условий лицензии. |
| Reasoning | Да | В паспортной классификации модель поддерживает рассуждение. |
| Preview | Нет | В данном срезе оценивается не preview-версия. |
| Контекст | 524 288 токенов | Значение из паспорта рейтинга; фактический лимит зависит от провайдера и режима. |
| Artificial Analysis Intelligence Index | 41,2 | Индекс Artificial Analysis в собственной шкале, не процент качества. |
| LMArena Text | 1406,6; место 137; 13 438 голосов | Статистический рейтинг слепых попарных сравнений и объём выборки. |
| LMArena Code | 1402,8; место 67 | Отдельный рейтинг Code Arena, не процент успешно решённых задач. |
Место в рейтинге
28-я позиция отражает не провал отдельного теста, а компромисс между несколькими измерениями. Итоговый COMRAD Score рассчитывается из пяти суббаллов с весами: качество — 40%, человеческое предпочтение — 30%, кодирование — 15%, эффективность — 10%, доступность — 5%. Поэтому Inkling small получает заметную поддержку от хорошей экономики и удобства доступа, но не может полностью компенсировать этим средний показатель качества и низкий кодовый балл.
Здесь важно не перепутать разные шкалы. Artificial Analysis Intelligence Index 41,2 — самостоятельный индекс провайдера измерений. LMArena Text 1406,6 — рейтинг по предпочтениям пользователей в слепых сравнениях; это не означает, что модель отвечает правильно в 1406,6 случаях из какого-либо числа. Аналогично, место 137 в текстовой арене и место 67 в кодовой арене нельзя превращать в проценты успешности.
Число в 13 438 голосов делает текстовую позицию более информативной, чем результат на совсем маленькой выборке, но не устраняет ограничения метода. LMArena показывает, какую модель чаще выбирали в конкретной среде сравнений, с конкретными промптами и распределением запросов. Для корпоративного RAG, русского юридического корпуса, внутренних инструментов или длинных репозиториев такой рейтинг нужно дополнять собственными тестами.
Внутри рейтинга Inkling small выглядит как модель с хорошим соотношением полезности и эксплуатационных затрат. Её не стоит выбирать только по месту: более важен разрыв между суббаллами. Если продукту нужны быстрые ответы, мультимодальный ввод и большой объём недорогих запросов, профиль выглядит привлекательно. Если продукту нужны точные изменения в кодовой базе, автономное исправление тестов и устойчивое следование сложной технической спецификации, слабый coding score требует отдельной проверки.
Разбор пяти суббаллов
| Суббалл | Оценка | Интерпретация |
|---|---|---|
| Quality | 64,6 | Средняя часть профиля. Модель может быть полезной в широких задачах, но итоговая точность не является её главным преимуществом. |
| Human preference | 81,0 | Сильная оценка по пользовательским предпочтениям, согласующаяся с текстовым LMArena-рейтингом. Не заменяет предметную проверку фактов. |
| Coding | 44,4 | Главная зона риска в редакционном профиле. Для кода нужны тесты на конкретном языке, стеке и типе репозитория. |
| Efficiency | 84,4 | Один из главных аргументов модели: высокая скорость и низкая стоимость в паспортном режиме. |
| Access | 96,4 | Модель легко учитывать в сценариях, где важны открытые веса, API-доступ и возможность самостоятельного развёртывания. |
Суббаллы — это нормализованные редакционные оценки от 0 до 100. Они не являются вероятностями, долями правильных ответов или гарантией того, что модель сохранит одинаковое поведение на любом провайдере.
Возможности и сценарии
Согласно официальным материалам Thinking Machines Lab, Inkling-Small принимает текст, изображения и аудио, а выдаёт текст. Model card описывает её как мультимодальную авторегрессионную модель общего назначения для чат-ботов, coding assistants, retrieval-augmented generation, агентских и tool-use систем. Это делает модель интересной не только для обычного диалога.
Недорогие текстовые сервисы
При цене 0,30 доллара за миллион входных токенов и 1,20 доллара за миллион выходных токенов из паспортного среза модель подходит для массовых операций: черновой классификации обращений, извлечения полей из документов, предварительной маршрутизации запросов, суммаризации длинных переписок и подготовки вариантов ответа. В таких системах можно отделить дешёвый первый проход от более дорогой проверки сложных случаев.
Мультимодальные документы
Поддержка изображений и аудио расширяет сценарии до разбора скриншотов, таблиц, диаграмм, голосовых заметок и записей встреч. Официальный релиз отдельно отмечает визуальное рассуждение с использованием Python для операций вроде приближения, обрезки и программного исследования изображения. На практике это полезно там, где важен не просто OCR, а ответ по структуре графика или содержанию небольшого элемента на странице.
Агенты и инструменты
Reasoning и заявленная поддержка tool-use делают Inkling small кандидатом для агентов, которые вызывают поиск, базы данных, интерпретаторы или внутренние API. Однако высокий efficiency score не доказывает надёжность агента. Для рабочего контура важны корректное завершение циклов, отсутствие повторных вызовов, обработка ошибок инструментов и способность не выдумывать результат операции.
Дообучение и исследовательские прототипы
Открытые веса позволяют изучать поведение модели, собирать адаптеры и интегрировать её в собственные продукты в рамках Apache 2.0 и применимых правил использования. При этом 276 млрд параметров — это крупная модель по общей ёмкости, даже если активными на токен являются 12 млрд. Поэтому самостоятельное развёртывание в полном формате потребует серьёзной инфраструктуры, а наличие весов не превращает локальный запуск в задачу для обычного ноутбука.
Архитектура и открытые веса
Официальный model card описывает Inkling-Small как 42-слойный decoder-only transformer со sparse Mixture-of-Experts: токены маршрутизируются к части экспертов, при этом используются общие эксперты. В карточке также указаны BF16, MXFP8 и NVFP4, а входные модальности включают текст, изображения и WAV-аудио с частотой 16 кГц. Эти сведения относятся к опубликованному checkpoint и не должны автоматически переноситься на сторонние квантизации или несовместимые серверные сборки.
Официальный релиз говорит о контекстном окне до 1 млн токенов, тогда как паспорт COMRAD404 в зафиксированном рейтинговом режиме содержит 524 288 токенов. Для выбора API следует ориентироваться на конкретное предложение провайдера: маркетинговый максимум модели, лимит выбранного сервера, длина доступного вывода и фактическое поведение на длинном контексте могут различаться.
Apache 2.0 обычно упрощает коммерческое использование весов, но перед публикацией продукта нужно проверить лицензионные уведомления, acceptable use policy, ограничения конкретного провайдера и статус дополнительных компонентов. «Открытые веса» означают доступ к параметрам модели, а не отсутствие требований к безопасности, мониторингу, аппаратному обеспечению и программному стеку.
Цена и скорость
В паспортном срезе указаны 0,30 доллара за миллион входных токенов и 1,20 доллара за миллион выходных токенов. Это разные тарифные единицы: стоимость входа нельзя складывать с ценой выхода без учёта фактического соотношения токенов. Например, длинный системный контекст и короткий ответ будут стоить иначе, чем короткий запрос с большим объёмом рассуждений и выдачи.
Скорость вывода составляет 238,1 токена в секунду, а время до первого токена — 0,75 секунды в режиме, отражённом паспортом. Эти значения полезны для оценки интерактивности, но зависят от API-провайдера, нагрузки, размера батча, региона, квантизации, длины входа и выбранного режима reasoning. Их следует воспринимать как снимок измерений, а не как SLA.
Практическая экономика Inkling small особенно заметна в конвейерах с большим количеством однотипных запросов. Важно отдельно учитывать скрытые рассуждательные токены, повторную передачу контекста, кэширование префикса, лимиты параллельности и стоимость инструментов. Низкая цена за токен не гарантирует низкую стоимость задачи, если модель расходует много токенов на рассуждение или часто повторяет вызовы инструментов.
Ограничения
Кодовый профиль. Coding subscore 44,4 — главный сигнал осторожности. LMArena Code rating 1402,8 и место 67 дают независимую точку сравнения, но не отвечают на вопросы о вашем репозитории. Модель может хорошо писать небольшие фрагменты и хуже справляться с многофайловой архитектурой, миграциями, тестами и неявными соглашениями команды.
Фактическая надёжность. Human preference 81,0 не равен точности. Убедительный стиль ответа может скрывать ошибку, особенно в технических, финансовых, медицинских и юридических задачах. Model card рекомендует человеческий контроль и дополнительную валидацию для высокорисковых сценариев.
Языки и домены. В официальной карточке заявлен английский и общая мультиязычность. Это не является гарантией одинакового качества для русского, редких языков, диалектов или узких профессиональных корпусов. Русскоязычный продукт нужно проверять отдельно на терминологии, склонениях, цитировании и следовании формату.
Инфраструктура. Общий объём параметров велик. Даже при MoE-маршрутизации требования к памяти, пропускной способности и межGPU-соединению могут быть существенными. Квантизированные варианты снижают требования, но меняют аппаратный профиль и могут влиять на качество, стабильность и совместимость.
Знания и безопасность. Модель ограничена датой своего обучающего среза и не должна считаться источником актуальных фактов без внешнего поиска. Открытая модель требует прикладных фильтров, rate limiting, журналирования, red teaming и контроля доступа. Встроенные меры безопасности нельзя считать достаточными для неограниченного публичного развёртывания.
Кому стоит выбрать Inkling small
Модель оправдана, если проекту нужны сразу несколько свойств: невысокая стоимость API, быстрый поток вывода, мультимодальный ввод, reasoning, открытые веса и возможность экспериментировать с дообучением. Хорошими кандидатами будут внутренние помощники, обработка документов, генерация черновиков, voice-to-text пайплайны с последующим анализом, мультимодальные прототипы и системы, где дорогая модель используется только для эскалации сложных случаев.
Выбор менее очевиден для команд, которым нужен прежде всего программный агент с высокой автономностью. В этом случае Inkling small можно включить в пилот, но не следует заранее назначать её единственным исполнителем. Рациональная схема — использовать модель для дешёвого анализа и простых исправлений, а рискованные изменения пропускать через тесты, ревью и отдельный маршрут проверки.
Как проверить на своей задаче
- Соберите репрезентативный набор. Возьмите не демонстрационные примеры, а 100–300 реальных запросов: простые, средние, сложные, пограничные и заведомо неразрешимые.
- Разделите метрики. Для текста измеряйте точность, полноту, соблюдение формата и фактические ошибки. Для кода — прохождение тестов, корректность diff, число затронутых файлов и долю ручных исправлений.
- Проверьте режимы reasoning. Сравните минимальное, среднее и максимальное усилие. Фиксируйте не только качество, но и число выходных токенов, задержку и стоимость одной завершённой задачи.
- Проведите мультимодальные тесты. Добавьте сканы, таблицы, диаграммы, фотографии экранов и аудио разного качества. Отдельно проверяйте мелкий текст, шум, неправильную ориентацию и несколько объектов в одном изображении.
- Проверьте длинный контекст. Используйте документы с известным ответом в начале, середине и конце. Сравнивайте результат при 8K, 32K, 128K и более длинных входах, не принимая заявленный максимум за фактическую гарантию.
- Тестируйте инструменты. Подготовьте мок-серверы с ошибками, пустыми ответами, тайм-аутами и конфликтующими данными. Хороший агент должен корректно остановиться или повторить вызов по правилам, а не сообщить о несуществующем результате.
- Проверьте безопасность. Добавьте prompt injection, попытки извлечь системные инструкции, вредоносные вложения и запросы на персональные данные. Оценивайте не только отказы, но и избыточные отказы на безвредных задачах.
- Считайте стоимость процесса. Включите входные и выходные токены, reasoning, кэширование, tool calls, повторные запросы и резервный маршрут. Сравнивайте цену не сообщения, а успешно завершённой задачи.
Минимальный критерий запуска — не средний балл в публичном рейтинге, а стабильное выполнение заранее определённых требований на вашей выборке. Для критичных решений нужен человек в контуре и журналирование всех входов, ответов, инструментов и версий runtime.
Итог
Inkling small занимает 28-е место не благодаря одной выдающейся метрике, а благодаря сбалансированной экономике: 84,4 за эффективность, 96,4 за доступность и 81,0 за человеческое предпочтение заметно поддерживают итоговые 70,0 балла. Цена 0,30/1,20 доллара за миллион входных/выходных токенов и скорость 238,1 токена в секунду делают её привлекательной для масштабных и интерактивных сценариев.
Главное ограничение — кодовый суббалл 44,4, за которым следует не максимальный показатель качества 64,6. Поэтому лучший способ использовать модель — не объявлять её универсальным решением, а встроить в архитектуру с маршрутизацией: простые и мультимодальные запросы отдавать Inkling small, сложные или рискованные — отправлять на дополнительную проверку. Для команды, которой нужны открытые веса и низкая стоимость, это сильный кандидат на пилот. Для безусловно надёжного автономного программирования — только кандидат на сравнительное испытание.
FAQ
Какое место Inkling small заняла в рейтинге COMRAD404?
Inkling small заняла 28-е место в редакции COMRAD404 2026 H2. Её COMRAD Score составляет 70,0 из 100. Это нормализованная редакционная оценка, а не процент качества или правильных ответов.
Какие главные преимущества модели?
Главные преимущества — высокая редакционная оценка эффективности 84,4, доступности 96,4 и человеческого предпочтения 81,0, а также открытые веса, лицензия Apache 2.0, reasoning и поддержка текста, изображений и аудио.
Подходит ли Inkling small для программирования?
Модель можно тестировать в coding и agentic workflows, но её кодовый суббалл COMRAD404 равен 44,4. Это слабейшая часть профиля, поэтому для рабочих репозиториев обязательны тесты на собственных задачах, проверка diff и человеческое ревью.
Сколько стоит использование Inkling small?
В паспортном срезе указаны 0,30 доллара за миллион входных токенов и 1,20 доллара за миллион выходных токенов. Итоговая сумма зависит от провайдера, режима reasoning, длины контекста, кэширования, повторов и вызовов инструментов.
Какой у модели контекст?
В паспорте COMRAD404 зафиксировано 524 288 токенов. Официальные материалы разработчика заявляют контекст до 1 млн токенов. Эти значения относятся к разным уровням описания, поэтому перед интеграцией нужно проверить лимит конкретного API или runtime.
Можно ли запустить модель локально?
Открытые веса допускают самостоятельное развёртывание, а официальные и экосистемные материалы описывают варианты для Transformers, vLLM, SGLang и квантизированных сборок. Однако 276 млрд параметров — это крупный checkpoint, поэтому требования к памяти и GPU нужно рассчитывать для конкретной точности и конфигурации.
Источники
- Рейтинг COMRAD404 — редакционная методология и место модели в срезе 2026 H2.
- Introducing Inkling-Small — официальный релиз, заявленные возможности, мультимодальность, reasoning, открытые веса и данные собственных оценок разработчика.
- Inkling-Small Model Card — дата релиза 30 июля 2026 года, лицензия, назначение, архитектура, модальности, параметры и ограничения.
- Официальный репозиторий весов на Hugging Face — доступ к checkpoint, инструкции запуска, поддерживаемые форматы и сведения о локальном использовании.
- Artificial Analysis: LLM Leaderboard — Intelligence Index, цены, скорость, контекст и функции API в зафиксированном срезе рейтинга.
- LMArena Text Leaderboard — текстовый рейтинг, позиция и число пользовательских голосов.
- LMArena Leaderboard — результаты Code Arena, использованные в кодовом суббалле.
- Tinker Models & Pricing — пример провайдерских тарифов и лимитов Tinker; цены могут отличаться от паспортного режима COMRAD404.
