Оперативная лента

Короткие русскоязычные разборы популярных AI-сигналов из Telegram, Reddit, X и YouTube. Соцсети здесь работают как радар тем, а факты проверяются по первичным источникам.

214 сигналов

Как читать эту ленту

Каждый пост отвечает на четыре вопроса: что произошло, почему это обсуждают, что подтверждено и что пока не ясно. Если тема пришла из соцсетей без сильного подтверждения, она маркируется как обсуждение, а не как факт.

Редакционная обложка COMRAD404: SearchAuditor: как находить и исправлять сбои длинных поисковых агентов

SearchAuditor: как находить и исправлять сбои длинных поисковых агентов

На arXiv вышел препринт SearchAuditor: авторы представили бенчмарк SearchAuditBench и фреймворк для локализации, атрибуции и исправления ошибок в длинных поисковых агентах.

Открыть сигнал →
Редакционная обложка COMRAD404: PRISM: как научить мультимодальные модели исполнять приоритизированные инструкции

PRISM: как научить мультимодальные модели исполнять приоритизированные инструкции

PRISM — четырёхэтапный синтез данных для обучения мультимодальных LLM следовать многошаговым рубрикам. На 10K примерах Qwen3-VL-4B вырос с 9,5% до 30,1% по строгой метрике...

Открыть сигнал →
Редакционная обложка COMRAD404: DiSR: разделение 3D-восприятия и пространственных рассуждений

DiSR: разделение 3D-восприятия и пространственных рассуждений

Новый препринт arXiv предлагает DiSR — фреймворк, который разделяет 3D-восприятие и пространственные рассуждения: готовые модели восприятия строят структурированные 3D-данные, а LLM с LoRA рассуждает...

Открыть сигнал →
Редакционная обложка COMRAD404: «Хватит платить за пять подписок»: соло-разработчик показал агрегатор AI-моделей Fius

«Хватит платить за пять подписок»: соло-разработчик показал агрегатор AI-моделей Fius

Соло-разработчик представил Fius — агрегатор AI-моделей с единым токеном и общим биллингом. Разбираем, что заявлено в посте на r/artificial и что стоит проверить.

Открыть сигнал →
Редакционная обложка COMRAD404: FinProBench: как оценивать финансовых ИИ-агентов по стандартам профессионалов

FinProBench: как оценивать финансовых ИИ-агентов по стандартам профессионалов

Препринт FinProBench предлагает строить рубрики оценки для финансовых ИИ-агентов на основе реальных профессиональных deliverables. Для узких ролей это заметно эффективнее обычных промптов.

Открыть сигнал →
Редакционная обложка COMRAD404: Почему Fireworks не поддерживает Voice AI: гипотеза с Hacker News

Почему Fireworks не поддерживает Voice AI: гипотеза с Hacker News

На Hacker News обсуждают, почему инференс-платформа Fireworks не добавляет открытые голосовые модели. Автор считает, что инференс надо оптимизировать под сценарий, а спрос на Kokoro,...

Открыть сигнал →
Редакционная обложка COMRAD404: Правильный ответ без правильной нормы: аудит юридических бенчмарков

Правильный ответ без правильной нормы: аудит юридических бенчмарков

Новый препринт arXiv (cs.CL): LLM верно отвечают на вопросы тайваньского бар-экзамена, но спонтанно ссылаются не на те нормы. Авторы предлагают оценивать ответ и правовое...

Открыть сигнал →
Редакционная обложка COMRAD404: JudgeArena: единый фреймворк для оценки LLM-судей появился на arXiv

JudgeArena: единый фреймворк для оценки LLM-судей появился на arXiv

Препринт JudgeArena объединяет AlpacaEval, Arena-Hard, MT-Bench и m-Arena-Hard под единым интерфейсом со сменными судьями и логированием метаданных. Разбираем, что подтверждено, а что пока заявлено...

Открыть сигнал →