Запись архива

Step 3.5 Flash: обзор модели StepFun по рейтингу COMRAD404

Step 3.5 Flash занимает 58-е место в рейтинге COMRAD404: модель выделяется низкой ценой, сильным пользовательским предпочтением и открытыми весами, но имеет ограниченную уверенность оценки и неполный набор независимых метрик.

Step 3.5 Flash от StepFun — профиль модели с рейтингом COMRAD404, ценой API и открытыми весами

Step 3.5 Flash — практичный недорогой вариант для тех, кому нужны открытые веса, длинный контекст и агентские сценарии без перехода к дорогим API. В срезе COMRAD404 от 31 августа 2026 года модель занимает 58-е место с COMRAD Score 63,7. Её профиль неоднороден: редакционная оценка эффективности достигает 95,3 из 100, human preference — 77,7, а quality и coding получили по 50,0. Поэтому Step 3.5 Flash разумно рассматривать не как универсального победителя, а как экономичный инструмент для потоковых задач, интеграций и локального или контролируемого развёртывания.

Коротко

Step 3.5 Flash разработана компанией StepFun. В паспорте COMRAD404 она отмечена как модель с открытыми весами под лицензией Apache 2.0; это не означает, что весь окружающий программный стек автоматически является свободным ПО. Модель не помечена как preview, а режим reasoning в паспорте отсутствует.

  • Позиция: 58-е место в рейтинге COMRAD404, редакция 2026 H2.
  • COMRAD Score: 63,7 из 100. Это нормализованная редакционная оценка, а не вероятность правильного ответа.
  • Сильнейшая сторона: efficiency — 95,3 из 100.
  • Ещё один заметный результат: human preference — 77,7 из 100.
  • Основная неопределённость: в срезе нет Artificial Analysis Intelligence Index, кодового рейтинга LMArena и измерений скорости.
  • Цена в паспорте: 0,10 доллара за миллион входных токенов и 0,30 доллара за миллион выходных токенов.
  • Контекст: 262 144 токена.

Итоговый выбор зависит от того, что важнее: минимальная стоимость и возможность контролировать развёртывание или максимально полная независимая картина качества. Для первого сценария модель выглядит убедительно; для второго данных недостаточно.

Паспорт модели

Параметр Значение в срезе 31.08.2026
Модель Step 3.5 Flash
Разработчик StepFun
Место COMRAD404 58
COMRAD Score 63,7 из 100
Лицензия Apache 2.0
Открытые веса Да
Reasoning Нет в паспорте
Preview Нет
Уверенность оценки Ограниченная
Контекст 262 144 токена
Вход $0,10 за 1 млн токенов
Выход $0,30 за 1 млн токенов

Официальная карточка модели на Hugging Face описывает Step 3.5 Flash как разреженную MoE-модель с 196 млрд параметров всего и 11 млрд активных параметров на токен, а также указывает заявленный контекст 256K. Эти сведения относятся к материалам разработчика и не заменяют независимые измерения из паспорта COMRAD404. ([huggingface.co](https://huggingface.co/stepfun-ai/Step-3.5-Flash?utm_source=openai))

Место в рейтинге

58-я позиция означает, что Step 3.5 Flash находится в рабочей середине рейтинга, но не входит в группу моделей с наиболее высокой совокупной редакционной оценкой. При этом одно место не раскрывает характер результата. COMRAD Score складывается из пяти нормализованных суббаллов с разными весами: quality — 40%, human preference — 30%, coding — 15%, efficiency — 10%, access — 5%.

В случае Step 3.5 Flash итог 63,7 поддержан прежде всего оценками human preference и efficiency. Иными словами, модель хорошо выглядит там, где важны субъективная полезность в диалоге, доступность и экономичность использования. Более слабые quality и coding ограничивают вывод о том, что она одинаково надёжна в сложном анализе и программной разработке.

Рейтинг COMRAD404 — редакционная сводка, а не единый тест. Полную методологию и положение модели в общем списке можно посмотреть на странице рейтинга COMRAD404.

Разбор пяти суббаллов

Суббалл Оценка Вес Что это значит для выбора
Quality 50,0 40% Нет основания считать модель стабильно сильной на всём спектре сложных задач.
Human preference 77,7 30% Пользовательские сравнения заметно поддерживают итоговый результат.
Coding 50,0 15% Для кода модель требует собственного тестирования; уверенного преимущества паспорт не показывает.
Efficiency 95,3 10% Главный аргумент модели: низкая цена и эффективный профиль использования.
Access 67,9 5% Доступность выше нейтрального уровня, но не максимальная.

Суббаллы нельзя читать как проценты качества. Значение 95,3 в efficiency не означает, что 95,3% запросов выполняются быстро или дёшево. Это нормализованная редакционная шкала 0–100, предназначенная для сопоставления профилей внутри рейтинга.

Что говорят независимые метрики

В паспорте есть текстовый результат LMArena: рейтинг 1394,5, 154-е место и 57 205 голосов. LMArena rating — статистический показатель слепых попарных сравнений пользовательских ответов, а не процент правильных ответов. Он полезен для оценки воспринимаемого качества диалога, но не заменяет проверки фактов, кода, следования формату или работы с инструментами. ([huggingface.co](https://huggingface.co/stepfun-ai/Step-3.5-Flash?utm_source=openai))

Текстовый рейтинг LMArena согласуется с относительно высоким human preference, но не подтверждает автоматически сильные результаты в программировании. В срезе отсутствуют LMArena code rating и code rank, поэтому делать вывод о положении модели в кодовой арене нельзя.

Artificial Analysis Intelligence Index в паспорте отсутствует. Это важное ограничение: редакция не восстанавливает значение по другим таблицам, сторонним пересказам или памяти. Отсутствуют и независимые показатели output tokens per second, time to first token и признаки того, что цена относится к одному неизменному провайдеру. Поэтому экономичность подтверждена паспортной оценкой и указанной ценой, но скорость в числах для этого среза не заявлена.

Возможности и сценарии

Профиль Step 3.5 Flash лучше всего подходит для задач, где стоимость запроса и возможность интеграции важнее максимальной глубины ответа. Это могут быть классификация обращений, извлечение полей из документов, суммаризация длинных переписок, подготовка черновиков, маршрутизация запросов и генерация структурированного JSON.

Агентские цепочки

Низкая стоимость делает модель удобной для многократных вызовов: планирование шага, обращение к инструменту, проверка результата и повторная попытка. В таких системах цена каждого отдельного ответа — только часть расходов; важны также количество итераций, длина передаваемой истории и стоимость внешних инструментов. Наличие длинного контекста может помочь удерживать журнал действий, но не гарантирует, что модель корректно выберет следующий шаг.

Работа с длинными материалами

Контекст 262 144 токена позволяет проектировать сценарии с большими кодовыми базами, массивными инструкциями или подборками документов. Однако вместимость окна не равна качеству извлечения информации из любой его части. На практике нужно проверять, как модель работает с данными в начале, середине и конце контекста, а также как ведёт себя при конфликтующих инструкциях.

Локальное развёртывание

Открытые веса расширяют контроль над размещением и обработкой данных. Но модель с большим общим числом параметров может предъявлять серьёзные требования к памяти, диску, квантованию, пропускной способности и поддержке конкретного inference-движка. Официальная карточка предлагает варианты запуска через Transformers и vLLM, а также описывает локальное развёртывание; это инструкция разработчика, а не гарантия одинаковой производительности на пользовательском оборудовании. ([huggingface.co](https://huggingface.co/stepfun-ai/Step-3.5-Flash?utm_source=openai))

Цена и скорость

По паспорту цена составляет $0,10 за миллион входных токенов и $0,30 за миллион выходных токенов. Приблизительную стоимость одного запроса можно считать так: входные токены делятся на миллион и умножаются на 0,10, затем к результату добавляются выходные токены, делённые на миллион и умноженные на 0,30.

Например, запрос с 20 000 входных и 4 000 выходных токенов по этим тарифным значениям стоит около $0,0032: $0,002 за вход и $0,0012 за выход. Это арифметическая иллюстрация по данным паспорта, а не обещание итогового счёта. Провайдер может менять тариф, правила округления, минимальный объём биллинга, доступность модели и ограничения по нагрузке.

Числа output tokens per second и time to first token в срезе отсутствуют. Официальная карточка StepFun заявляет типичный диапазон генерации 100–300 токенов в секунду и отдельные пиковые значения, но эти данные зависят от конфигурации и режима и не внесены в raw metrics паспорта. Их нельзя использовать как гарантированную скорость API. ([huggingface.co](https://huggingface.co/stepfun-ai/Step-3.5-Flash?utm_source=openai))

В официальной документации StepFun модель доступна с идентификатором step-3.5-flash; для совместимых интеграций приведены API-адреса и примеры настройки. Перед эксплуатацией следует проверить актуальную документацию провайдера, потому что API-режимы, лимиты и цены могут измениться. ([platform.stepfun.ai](https://platform.stepfun.ai/docs/en/step-plan/quick-start?utm_source=openai))

Открытые веса и лицензия

Статус open weights: true означает, что веса модели доступны для загрузки и самостоятельного запуска на условиях, указанных в лицензии. В паспорте указана Apache 2.0. Для коммерческого использования всё равно нужно проверить лицензионные уведомления, условия конкретных квантованных сборок, компоненты inference-стека и ограничения выбранного хостинга.

Открытые веса особенно полезны организациям, которым требуется уменьшить зависимость от одного API-провайдера, держать данные внутри собственного контура или воспроизводить эксперименты с фиксированной версией. Но самостоятельный запуск переносит ответственность за обновления безопасности, мониторинг, масштабирование и качество на команду пользователя.

Ограничения

  • Ограниченная уверенность. Паспорт прямо указывает confidence как «ограниченная». Это связано не с одним конкретным дефектом, а с неполным покрытием независимыми источниками и метриками.
  • Нет Artificial Analysis Intelligence Index. Нельзя корректно описать место модели по этой системе измерений.
  • Нет кодового рейтинга LMArena. Значение coding 50,0 является редакционной оценкой и не подменяется отсутствующим raw metric.
  • Нет измерений скорости. Нельзя обещать конкретное время до первого токена или устойчивую скорость генерации.
  • Неполная картина reasoning. В паспорте reasoning отмечен как false. Поэтому модель не следует называть reasoning-моделью на основании маркетингового описания или отдельных тестов.
  • Длинный контекст требует проверки. 262 144 токена показывают размер окна, но не гарантируют равномерное качество на всей длине.
  • Локальный запуск не бесплатен. Открытые веса не отменяют затрат на GPU, память, хранение, обслуживание и совместимость.

Отдельно важно разделять официальный материал StepFun и редакционную интерпретацию. Разработчик описывает архитектурные особенности, возможности и рекомендуемые способы запуска; COMRAD404 нормализует собственный набор критериев, а LMArena отражает пользовательские слепые сравнения.

Кому подойдёт Step 3.5 Flash

Модель стоит рассматривать командам, которым нужна недорогая рабочая лошадка для большого потока текстовых операций, экспериментальных агентов, внутренних помощников и приложений с длинными входными документами. Она также интересна разработчикам, которые хотят иметь путь от API к локальному запуску с открытыми весами.

Осторожнее следует подходить к выбору для критичных программных задач, где ошибка компиляции, неверный патч или пропущенное условие дорого обходятся. Нейтральный coding subscore и отсутствие независимого LMArena code rating означают, что здесь нельзя полагаться на общую позицию модели в рейтинге.

Как проверить на своей задаче

  1. Соберите реальные примеры. Возьмите 30–100 запросов из рабочего потока: документы, тикеты, фрагменты кода и типовые ошибки, а не только удобные демонстрации.
  2. Зафиксируйте формат ответа. Для JSON, SQL, патчей и классификаций заранее задайте схему, допустимые значения и критерии автоматической проверки.
  3. Разделите качество и стоимость. Записывайте входные и выходные токены, число повторных вызовов, задержку до первого токена и полное время ответа.
  4. Проверьте длинный контекст. Разместите контрольные факты в начале, середине и конце большого документа, затем попросите модель найти их и объяснить источник вывода.
  5. Протестируйте агентский контур. Ограничьте инструменты песочницей, добавьте намеренно ошибочные результаты и проверьте, умеет ли модель остановиться, повторить шаг или запросить уточнение.
  6. Сравнивайте версии и провайдеров отдельно. Одинаковое имя модели не означает одинаковую квантовку, системный промпт, лимиты или серверное окружение.
  7. Оцените риск. Для медицинских, юридических, финансовых и производственных процессов добавьте обязательную проверку человеком и журналирование всех вызовов.

Минимальный пилот должен включать базовую модель качества, стоимость на один успешный результат и долю ответов, которые требуют ручной правки. Именно эти показатели помогут понять, компенсирует ли низкая цена дополнительные проверки.

Как читать результат COMRAD404

Для Step 3.5 Flash итоговый балл нельзя сводить к одной цифре. При заданных весах quality сильнее всего влияет на результат, поэтому среднее значение 50,0 ограничивает потенциал модели даже при очень высокой efficiency. Human preference с весом 30% заметно поддерживает итог, а access влияет слабее из-за веса 5%.

Такой профиль подсказывает практическую стратегию: использовать модель там, где запросов много, ответы можно валидировать автоматически, а выигрыш от низкой стоимости накапливается на масштабе. Если задача требует редких, но максимально точных рассуждений или надёжного сложного рефакторинга, решение нужно принимать только после собственного набора тестов.

FAQ

Какое место занимает Step 3.5 Flash?

В редакции COMRAD404 2026 H2 модель занимает 58-е место. Её COMRAD Score равен 63,7 из 100.

Можно ли считать 63,7% правильных ответов?

Нет. COMRAD Score и пять суббаллов — нормализованные редакционные оценки по шкале 0–100, а не проценты качества или доля верных ответов.

Что означает рейтинг LMArena 1394,5?

Это статистический рейтинг по слепым попарным сравнениям ответов пользователей. В паспорте для Step 3.5 Flash также указаны 154-е место и 57 205 голосов. Это не процент правильных ответов.

Сколько стоит модель?

В паспорте указаны $0,10 за миллион входных токенов и $0,30 за миллион выходных токенов. Фактическая цена зависит от провайдера, режима, правил биллинга и изменений тарифов.

Известна ли скорость Step 3.5 Flash?

В зафиксированном срезе нет значений output tokens per second и time to first token. Официальные заявления о скорости нельзя воспринимать как универсальную гарантию для любого API или локальной конфигурации.

Подходит ли модель для программирования?

Паспорт даёт coding subscore 50,0, но не содержит LMArena code rating и code rank. Поэтому модель можно включать в пилот по разработке, однако её пригодность нужно подтверждать собственными тестами.

Является ли Step 3.5 Flash reasoning-моделью?

В паспорте COMRAD404 поле reasoning отмечено как false. В статье не следует считать модель reasoning-моделью только потому, что официальный материал описывает агентские или сложные задачи.

Источники

  • Step 3.5 Flash на Hugging Face — официальная карточка: название, разработчик, лицензия, способы запуска, заявленные архитектурные характеристики и возможности.
  • StepFun Documentation: Quick Start — идентификатор модели step-3.5-flash, API-режимы и базовые параметры подключения.
  • Официальный репозиторий Step-3.5-Flash — материалы разработчика, инструкции для локального запуска и интеграции.
  • Технический отчёт Step 3.5 Flash — публикация разработчиков с описанием модели и заявленными результатами на отдельных тестах.
  • LMArena Text Leaderboard — источник текстового рейтинга, места и числа голосов, использованных в паспорте.
  • Artificial Analysis: LLM Leaderboard — предусмотренный методологией источник, но Intelligence Index для этой модели в зафиксированном паспорте отсутствует.