LongCat Flash Chat 2602 Exp — интересная разговорная модель для изучения пользовательских предпочтений, но не практичный выбор для нового production-проекта. При COMRAD Score 61,1 её профиль держится прежде всего на сильном результате слепых сравнений LMArena. Одновременно в срезе нет независимых данных об Intelligence Index, программировании, цене, скорости и размере контекста. Более того, Meituan прекратила обслуживание этой версии на официальной API-платформе 29 мая 2026 года.
Это не означает, что модель плохо отвечает. Напротив, 27 990 голосов в Text Arena дают достаточно содержательный сигнал о том, что пользователи часто принимали её ответы положительно. Однако высокий результат в диалоговом сравнении нельзя автоматически переносить на точность, код, агентные цепочки или экономику массового применения.
Коротко
- Главная сильная сторона: высокая редакционная оценка человеческих предпочтений — 89,0 из 100.
- Положение: 89-е место в рейтинге COMRAD404 2026 H2 с итоговым баллом 61,1.
- LMArena: рейтинг 1435,7, 88-е место и 27 990 голосов в текстовой категории.
- Главный риск: официальное API-обслуживание модели прекращено, а актуальный способ прямого доступа к точной версии не подтверждён.
- Пробелы данных: нет зафиксированных значений Intelligence Index, цены, скорости, задержки первого токена, контекста и Code Arena.
- Статус: закрытая модель без открытых весов; наличие
Expв имени не следует путать с официальным статусом preview. - Вывод: годится как объект сравнительного тестирования, но для внедрения сначала потребуется подтвердить доступность конкретного endpoint и провести собственную проверку качества.
Паспорт модели
| Параметр | Значение в срезе |
|---|---|
| Модель | LongCat Flash Chat 2602 Exp |
| Разработчик | Meituan |
| Место COMRAD404 | 89 |
| COMRAD Score | 61,1 из 100 |
| Редакция рейтинга | 2026 H2, методология 1.0 |
| Лицензия | Proprietary |
| Открытые веса | Нет |
| Reasoning-модель | Нет |
| Официальный preview | Нет |
| Доверие к профилю | Ограниченное |
| Состояние официального сервиса | Прекращён 29 мая 2026 года |
Паспорт следует читать с учётом различий между метриками. COMRAD Score и суббаллы — нормализованные редакционные оценки по шкале 0–100, а не проценты качества. Рейтинг LMArena 1435,7 относится к статистической системе слепых попарных сравнений и также не показывает долю правильных ответов.
Место в рейтинге
LongCat Flash Chat 2602 Exp занимает 89-е место в общем рейтинге моделей ИИ COMRAD404. Итоговый результат 61,1 выглядит умеренным, но внутри него скрывается резко неравномерный профиль: модель сильнее воспринимается людьми в открытом диалоге, чем подтверждена независимыми инструментальными измерениями.
Наибольший вклад даёт суббалл human preference. При весе 30% оценка 89,0 добавляет к итоговому результату 26,7 пункта. Quality имеет вес 40%, но получает нейтральные 50,0 из-за отсутствия Artificial Analysis Intelligence Index. Coding и efficiency также остаются на уровне 50,0, поскольку необходимых исходных метрик в паспорте нет. Access равен 37,5 и дополнительно снижает результат из-за закрытой лицензии, отсутствия открытых весов и проблем с актуальной доступностью.
Поэтому 89-е место не стоит интерпретировать как точный порядковый список «умнее — глупее». Это позиция в многокомпонентной редакционной системе, где учитываются не только впечатления от ответа, но и проверяемое качество, программирование, эффективность и доступ.
Что говорят пять суббаллов
| Компонент | Баллы | Вес | Практическое прочтение |
|---|---|---|---|
| Quality | 50,0 | 40% | Intelligence Index отсутствует; нейтральная оценка не подтверждает среднее фактическое качество |
| Human preference | 89,0 | 30% | Сильный сигнал из Text Arena по открытым пользовательским сравнениям |
| Coding | 50,0 | 15% | Code Arena rating и место отсутствуют |
| Efficiency | 50,0 | 10% | Нет цены, скорости генерации и задержки первого токена |
| Access | 37,5 | 5% | Закрытая модель без весов, точная версия снята с официального обслуживания |
Три значения по 50,0 нельзя считать доказательством «среднего» уровня. В данном профиле они в первую очередь обозначают недостаточную наблюдаемость. Это важное различие: модель с измеренным средним результатом и модель без результата могут получить одинаковую нормализованную точку, но требуют разных решений при выборе.
Человеческие предпочтения и LMArena
Самый убедительный внешний сигнал — Text Arena. В зафиксированном срезе LongCat Flash Chat 2602 Exp имеет рейтинг 1435,7, занимает 88-е место и набрала 27 990 голосов. Пользователи LMArena сравнивают обезличенные ответы двух моделей и выбирают предпочтительный, после чего агрегированный рейтинг отражает относительные результаты множества парных столкновений.
Такой тест хорошо улавливает ясность, полезность, естественность, соблюдение инструкции, стиль и общее впечатление от диалога. Значительное число голосов делает результат полезнее единичной демонстрации или подборки примеров разработчика. При этом LMArena не является экзаменом с эталонным ответом. Модель может звучать убедительно и нравиться пользователю, но допускать фактические ошибки, не выдерживать строгий формат или генерировать код, который не проходит тесты.
Есть и статистическая неопределённость: на странице лидерборда для округлённого рейтинга показывался диапазон около ±5 пунктов и разброс возможного места. Поэтому соседние позиции не следует трактовать как безусловно различающиеся уровни. Для выбора важнее устойчивость модели на ваших типах запросов, чем разница в одну строку рейтинга.
Возможности и сценарии
Название и категория LMArena указывают прежде всего на текстовую чат-модель. Паспорт не относит её к reasoning-моделям и не содержит подтверждённых данных о мультимодальности. Без отдельной карточки точной версии безопасно исходить из ограниченного набора доказанных возможностей.
Где профиль выглядит уместно
- Диалоговые прототипы. Высокий human preference делает модель интересной для сравнительных испытаний ассистентов, справочных интерфейсов и генерации черновиков.
- Редакционные задачи. Можно проверять переформулирование, структурирование текста, варианты заголовков, ответы в заданном тоне и сокращение материалов.
- Классификация с участием человека. Модель может быть кандидатом для разметки обращений или подготовки проектов ответов, если результат обязательно проверяет оператор.
- Исследование UX. Сохранившиеся результаты Arena позволяют изучать, какие ответы воспринимаются пользователями как более полезные и естественные.
- Контрольный участник теста. Если доступ к точной версии сохранился у стороннего провайдера, её можно включить в закрытый набор кандидатов, не делая основной производственной зависимостью.
Что нельзя считать подтверждённым
В паспорте нет независимого Code Arena rating, поэтому нельзя рекомендовать модель как специализированного программиста. Нет Intelligence Index — нельзя уверенно оценить совокупную способность к знаниям, математике и сложным рассуждениям. Нет сведений о поддержке инструментов, структурированного вывода или конкретном контекстном окне именно у версии 2602-exp. Возможности других LongCat-моделей нельзя автоматически переносить на неё.
Доступность и жизненный цикл
Главный практический факт обнаружен в официальном журнале изменений Meituan: LongCat Flash Chat 2602 Exp вошла в перечень шести устаревших моделей, обслуживание которых прекратили 29 мая 2026 года. Текущая документация платформы перечисляет уже LongCat-2.0, а не рассматриваемую версию.
Следовательно, рейтинг описывает исторически измеренную модель, но не гарантирует возможность вызвать её сегодня через официальный API. Если сторонняя площадка всё ещё показывает такое имя, необходимо выяснить, действительно ли запрос направляется в неизменный snapshot, а не в псевдоним, автоматически перенаправленный на новую модель.
Отдельного официального release note, model card или репозитория для точной версии LongCat-Flash-Chat-2602-Exp в ходе исследования найти не удалось. Документация подтверждает её существование и снятие с обслуживания, но не раскрывает дату выпуска, архитектуру, размер, контекст или процедуру обучения. Открытые материалы базовой LongCat Flash Chat не следует использовать для заполнения этих пробелов: паспорт классифицирует версию 2602 Exp как proprietary и без открытых весов.
Цена и скорость
Данных о цене в срезе нет. Не опубликованы сопоставимые значения стоимости миллиона входных и выходных токенов именно для LongCat Flash Chat 2602 Exp. Текущие тарифы LongCat API относятся к другой модели и не могут использоваться как цена снятой версии.
Данных о скорости также нет. В паспорте отсутствуют output tokens per second и time to first token. Поэтому невозможно доказательно оценить как темп длинной генерации, так и отзывчивость интерфейса при первом ответе. Слово Flash в названии не заменяет измерение.
Если модель доступна через посредника, реальные расходы и задержка будут зависеть от API-провайдера, региона, нагрузки, режима потоковой выдачи, длины промпта и лимитов аккаунта. Перед закупкой следует запросить действующий тариф, политику маршрутизации и подтверждение идентичности backend-модели. Даже полученные значения нужно фиксировать с датой: цена и производительность сервиса могут изменяться.
Контекст, формат API и интеграция
Размер контекстного окна точной версии в паспорте не указан. Официальный журнал описывает контекст других поколений семейства, но переносить эти цифры на 2602 Exp без первичного материала нельзя. Для планирования документов безопасно считать лимит неизвестным, пока endpoint не вернёт метаданные модели или провайдер не предоставит документацию.
Современная платформа LongCat использует совместимые с OpenAI и Anthropic форматы API, однако актуальная документация перечисляет LongCat-2.0. Это подтверждает общий способ интеграции платформы, но не действующий доступ к LongCat Flash Chat 2602 Exp. Старый идентификатор в конфигурационном файле сам по себе ничего не гарантирует.
При проверке стороннего API полезно запросить список моделей, сохранить точный идентификатор ответа и проверить поведение на контрольных промптах. Если провайдер не раскрывает версию, дату snapshot и правила обновления alias, воспроизводимость теста будет низкой.
Ограничения
- Модель снята с официального обслуживания. Это основной стоп-фактор для нового продукта, которому нужны SLA, предсказуемые обновления и долговременная поддержка.
- Закрытая лицензия и отсутствие весов. Нельзя самостоятельно развернуть подтверждённую версию, проверить файлы модели или закрепить вычислительную среду.
- Ограниченное покрытие источниками. Из трёх внешних направлений паспорта заполнена только Text Arena; Artificial Analysis и Code Arena не дали метрик.
- Неизвестная экономика. Нет стоимости входа и выхода, пропускной способности и задержки первого токена.
- Неизвестный контекст. Нельзя заранее спроектировать обработку больших документов без эксперимента на доступном endpoint.
- Нет подтверждённого reasoning-режима. В паспорте модель отмечена как non-reasoning, поэтому сложные многошаговые задачи требуют особенно строгой внешней проверки.
- Риск смешения версий. Базовую LongCat Flash Chat, 2602 Exp и последующие модели семейства нельзя считать взаимозаменяемыми.
- Сильная стилистическая оценка не равна фактической надёжности. LMArena показывает предпочтение ответа, а не процент истинных утверждений.
Кому модель подходит
LongCat Flash Chat 2602 Exp может быть полезна исследователям лидербордов, командам с сохранённым легальным доступом к конкретному snapshot и специалистам, которые изучают расхождение между человеческими предпочтениями и инструментальными метриками. Её также разумно включить в ретроспективный тест диалоговых систем, если важно воспроизвести состояние рынка первой половины 2026 года.
Для нового коммерческого ассистента, критичного бизнес-процесса или долгосрочной API-интеграции профиль слабее. Здесь проблема не столько в итоговом балле, сколько в жизненном цикле: официальный сервис уже завершён, а цена, лимиты и стабильный канал доступа не определены. Выбирать такую зависимость можно только при наличии архивного контракта или проверенного провайдера, который гарантирует неизменность версии.
Как проверить на своей задаче
- Подтвердите доступ. Получите у провайдера точное имя backend-модели, статус endpoint, регион обработки, лицензионные условия и сведения о возможном перенаправлении alias.
- Соберите 50–200 реальных примеров. Не ограничивайтесь общими вопросами. Используйте обезличенные обращения, документы, инструкции и ошибки из вашего процесса.
- Разделите критерии. Оценивайте фактическую точность, выполнение инструкции, полноту, стиль, валидность формата, безопасность и время ответа отдельно.
- Проведите слепое сравнение. Уберите названия моделей и случайно меняйте порядок ответов. Это приблизит проверку к принципу LMArena и уменьшит влияние бренда.
- Проверяйте код исполнением. Для программирования используйте unit-тесты, статический анализ и изолированную среду. Красивое объяснение не считается рабочим решением.
- Измерьте длинные запросы. Постепенно увеличивайте объём входа, фиксируя отказ, обрезку, потерю деталей и фактическое число принятых токенов.
- Замерьте эксплуатацию. Записывайте медиану и 95-й перцентиль задержки первого токена, общую длительность, скорость генерации, ошибки и стоимость полного сценария.
- Повторите тест. Выполните несколько прогонов в разные часы. Если ответы или задержки резко меняются, провайдер может использовать динамическую маршрутизацию.
- Задайте порог допуска. Например, модель проходит только при заданной точности, доле валидного JSON и максимальной стоимости одной операции.
Для этой модели особенно важно сохранить дату, идентификатор endpoint и сырые ответы. Без открытых весов и официального активного сервиса повторить эксперимент позже может оказаться невозможно.
Редакционный вывод
LongCat Flash Chat 2602 Exp получила достойный общий результат благодаря тому, что её ответы нравились участникам слепых сравнений. Human preference 89,0 — содержательный плюс, подкреплённый почти 28 тысячами голосов. Но остальные части профиля либо нейтральны из-за отсутствия данных, либо указывают на слабую доступность.
COMRAD Score 61,1 здесь следует понимать как сочетание сильного диалогового впечатления и высокой неопределённости, а не как универсальную оценку интеллекта. Если у команды уже есть доступ к неизменной версии, модель заслуживает собственного A/B-теста. Если доступ только предстоит организовать, рациональнее сначала проверить жизненный цикл, цену и воспроизводимость сервиса — именно эти факторы, а не качество демонстрационного ответа, вероятнее всего определят итоговое решение.
FAQ
Что означает COMRAD Score 61,1?
Это нормализованная редакционная оценка по шкале 0–100, рассчитанная из пяти компонентов с разными весами. Она не означает 61,1% правильных ответов и не является прямым значением какого-либо одного бенчмарка.
Почему human preference настолько выше остальных суббаллов?
Для модели имеется сильный результат Text Arena: рейтинг 1435,7 при 27 990 голосах. По направлениям quality, coding и efficiency нужные исходные показатели отсутствуют, поэтому профиль не даёт столь же сильного подтверждения.
Можно ли сейчас вызвать модель через официальный API Meituan?
Официальный журнал изменений сообщает, что обслуживание LongCat Flash Chat 2602 Exp прекращено 29 мая 2026 года. В актуальной документации эта версия среди поддерживаемых моделей не указана.
Является ли модель открытой?
Нет. В паспорте она обозначена как proprietary, открытые веса отсутствуют. Открытость других моделей семейства LongCat нельзя переносить на версию 2602 Exp.
Известны ли цена, скорость и контекст?
Нет. В зафиксированном срезе отсутствуют цена входных и выходных токенов, скорость генерации, задержка первого токена и размер контекста. Значения других версий использовать вместо них нельзя.
Подходит ли LongCat Flash Chat 2602 Exp для программирования?
Подтверждённого Code Arena rating в паспорте нет. Модель можно испытать на собственном наборе репозиторных задач, но рекомендовать её как специализированный инструмент программирования по доступным данным нельзя.
Источники
- Официальный журнал изменений LongCat API — подтверждает существование точной версии и прекращение её обслуживания 29 мая 2026 года.
- Обзор LongCat API — описывает форматы API, аутентификацию и общую инфраструктуру текущей платформы.
- LMArena Text Leaderboard — источник рейтинга, места и числа голосов в текстовых слепых сравнениях.
- Artificial Analysis LLM Leaderboard — проверенный источник Intelligence Index и эксплуатационных метрик; данных точной версии в переданном срезе нет.
Срез профиля: 31 августа 2026 года. Числа COMRAD404 приведены по паспорту редакции 2026 H2, версия методологии 1.0. Уверенность в профиле ограниченная из-за неполного покрытия независимыми метриками и завершения официального сервиса.
