COMRAD404

Лента

Новости, инструменты и практика ИИ

CMU выложила открытый курс по ИИ-агентам: от обвязки до RL-обучения

Университет Карнеги — Меллон опубликовал на YouTube полный курс по созданию агентов. В программе — инструменты, память, планирование, дообучение и RL. Первое задание и стартовый...

POIL переносит роботизированные навыки по одной демонстрации с помощью 3D-точек

Метод POIL использует функциональные точки объекта для переноса показанного движения и замкнутого управления роботом без готовой 3D-модели или отдельного оценщика позы.

Разобраться в теме

За чем вы следите?

Jev между LLM и узкими моделями: Себастьян Рашка разобрал эволюцию классификации текста

Себастьян Рашка проследил развитие классификации текста от bag-of-words до трансформеров и объяснил, где Jev может быть выгоднее универсальных LLM, а где уступит специализированной модели.

Один алгоритм для всех работодателей: MIT уточнил риски «монокультуры» в найме

Исследователи MIT смоделировали рынок, на котором компании используют одинаковый алгоритм найма. Главным риском оказалась потеря разнообразия решений, а возможной защитой — ансамбль моделей.

HybridInfer: тепловой запас смартфона стал сигналом для маршрутизации LLM

Препринт HybridInfer описывает роутер, который выбирает между локальной, периферийной и облачной LLM с учётом теплового состояния смартфона, сложности запроса и стоимости инференса.

Рейтинг COMRAD404

Какая модель подходит для вашей задачи?

Топ-100 моделей: качество, код, скорость и стоимость. С фильтрами и описанием методологии.

Открыть рейтинг

Аудит LLM-судьи в Text-to-SQL выявил почти случайное согласие с экспертами

Авторы нового препринта проверили LLM-судью на базе gpt-4o-mini в рабочем Text-to-SQL-сервисе. На выборке с повышенной долей спорных случаев каппа Коэна составила 0,04, а самостоятельно размещённая...

OpenAI и исследовательские центры оценили риски языковых моделей для дезинформации

OpenAI, CSET и Stanford Internet Observatory представили исследование о том, как большие языковые модели могут усилить кампании по дезинформации и какие меры помогут снизить связанные...

SkillCascade: безопасные по отдельности навыки ИИ-агента могут складываться в атаку

Авторы нового препринта описали каскадные атаки, при которых вредоносная цель распределяется между несколькими навыками ИИ-агента. Представленный ими SkillCascade-Bench содержит 213 проверенных сценариев.