Запись архива

TypeSafe AI представила Jev — модель для выбора действий вместо генерации текста

Jev возвращает вероятности для заранее заданных вариантов ответа. Первые пользователи сообщают об ускорении классификации, но их тесты пока не позволяют судить о работе модели на других задачах.

Jev от TypeSafe AI возвращает вероятности для заданных вариантов ответа
Jev от TypeSafe AI возвращает вероятности для заданных вариантов ответа
Изображение из исходного материала

TypeSafe AI представила Jev — модель для приложений, которым нужно выбрать один из заранее заданных вариантов, а не получить развёрнутый текстовый ответ. Разработчик определяет возможные результаты, а модель возвращает оценки вероятности. Такой формат может пригодиться при классификации писем, проверке команд и маршрутизации запросов к другим моделям.

О выпуске Jev 18 сентября 2026 года сообщил TechCrunch. Издание приводит первые сравнения, проведённые пользователями модели. Они указывают на возможную экономию времени и денег в отдельных сценариях, но пока не заменяют независимого тестирования.

Зачем отделять выбор действия от генерации текста

Основатель TypeSafe AI Диогу Алмейда ранее работал в OpenAI и участвовал в создании ChatGPT и развитии обучения с подкреплением на основе обратной связи от людей — RLHF. В разговоре с TechCrunch он объяснил подход стартапа расхождением между задачами языковых моделей и задачами программ: приложению нередко требуется конкретное решение, которое код сможет обработать дальше.

По описанию TypeSafe AI, Jev использует архитектуру трансформера, но её доступный пользователю результат — не текст, а вероятности заданных исходов. Компания называет её моделью «System One» и утверждает, что обучает исключительно на синтетических данных методом, который Алмейда именует обучением с подкреплением на калиброванных решениях. Достаточных сведений об архитектуре и обучении для независимой оценки этих утверждений компания, согласно TechCrunch, не раскрыла.

Ограничение ответа заданными вариантами устраняет проблему неожиданного текста вне предусмотренного формата. Оно не устраняет ошибочные решения: модель всё ещё может отнести письмо не к той категории или разрешить команду, которую следовало остановить. Отдельный вопрос — насколько возвращаемая вероятность соответствует реальной частоте правильных ответов. Без такой проверки число на выходе нельзя считать надёжной мерой риска.

Что сообщили первые пользователи Jev

Инженер Vercel Пранит Шарма рассказал TechCrunch об использовании Jev для классификации команд с точки зрения безопасности. По его словам, после замены прежней языковой модели обработка стала быстрее в 5–18 раз, а точность выросла. Издание не приводит независимого бенчмарка, по которому можно было бы распространить этот результат на другие наборы команд.

Технический директор Bryo AI Никхил Мудхолкар сравнил Jev с Gemini при классификации деловых писем. В его тесте Gemini оказалась немного точнее, тогда как применение Jev обошлось в 10–20 раз дешевле. Мудхолкар выделил оценки вероятности, которые возвращает Jev: на их основе приложение может решать, обрабатывать письмо автоматически или направить его на дополнительную проверку. Это наблюдение участника теста, а не подтверждение того, что то же соотношение цены и качества сохранится при иной нагрузке и других категориях.

TechCrunch также сообщает, что после запуска спрос на API Jev временно превысил возможности сервиса. Интерес разработчиков объясним, однако кратковременный всплеск обращений ничего не говорит о стабильности при длительной эксплуатации. Указанная в материале схема оплаты — без платы за выходные токены и с тарификацией входных по миллиардам — требует расчёта на реальном потоке запросов приложения, а не только сравнения расценок за токен.

Где вероятности помогают — и где нужен собственный тест

Один возможный сценарий — определить тип запроса перед отправкой его подходящей языковой модели. Другой — проверять действие ИИ-агента до выполнения. Технический директор Earendil Армин Ронахер предложил TechCrunch рассматривать Jev для маршрутизации и таких проверок, одновременно подчеркнув роль порога уверенности: разработчик сам решает, при какой оценке разрешить автоматическое действие.

Это решение зависит от цены ошибки. Для сортировки почты неверная категория может означать необходимость исправить метку. Для проверки команды ошибочное разрешение способно иметь более серьёзные последствия. Поэтому порог, выбранный для одного процесса, нельзя без испытаний переносить в другой. Особенно полезно посмотреть не только на среднюю точность, но и на случаи, когда модель уверенно принимает неверное решение.

Структурированный ответ сам по себе не уникален для Jev: способы получать ответы в заданном формате описаны и в документации OpenAI, и в документации Gemini. Отличие, о котором заявляет TypeSafe AI, — специализация Jev на выборе из заданных вариантов и соответствующие ожидания по скорости и стоимости. Эти страницы объясняют возможности других инструментов, но не подтверждают сравнительные показатели Jev.

Перед заменой действующего классификатора разработчикам стоит испытать обе системы на одном наборе собственных примеров: сопоставить ошибки по категориям, задержку под рабочей нагрузкой, общую стоимость обработки и соответствие заявленных вероятностей фактическим результатам. Пока опубликованные сравнения исходят от первых пользователей, о которых рассказал TechCrunch; их достаточно для постановки такого теста, но не для вывода, что Jev станет универсальной заменой языковой модели или надёжным фильтром действий агента.

Источники