Оперативная лента ИИ-сигналов

214 материалов

Короткие проверки популярных AI-сигналов из Telegram, Reddit, X и YouTube: что произошло, чему верить и почему это важно.

Редакционная обложка COMRAD404: Council 1.2: слепое рецензирование ответов ИИ — анонс на Reddit

Council 1.2: слепое рецензирование ответов ИИ — анонс на Reddit

Пользователь Reddit анонсировал версию 1.2 инструмента Council с открытым исходным кодом, который отправляет один вопрос нескольким моделям ИИ и проводит анонимную взаимную рецензию ответов....

Открыть материал →
Редакционная обложка COMRAD404: Почему preference-тесты видео-моделей не доказывают, что они «мировые модели»: обсуждение на Reddit

Почему preference-тесты видео-моделей не доказывают, что они «мировые модели»: обсуждение на Reddit

Пользователь Reddit в r/artificial критикует практику называть видеогенераторы «мировыми моделями» на основе внутренних preference-тестов, которые не поддаются воспроизведению и не измеряют физическое понимание.

Открыть материал →
Редакционная обложка COMRAD404: Khondo: первый бенчмарк для разделения пачек документов на примере бенгальских форм

Khondo: первый бенчмарк для разделения пачек документов на примере бенгальских форм

Исследователи представили Khondo — первый бенчмарк для разделения объединённых PDF-пакетов на отдельные документы. Тестирование MLLM показало: кластеризация страниц удаётся неплохо, но восстановление исходного порядка...

Открыть материал →
Редакционная обложка COMRAD404: Новый подход к оценке персональных LLM-агентов: временные вмешательства и состояние пользователя

Новый подход к оценке персональных LLM-агентов: временные вмешательства и состояние пользователя

arXiv:2607.21635v1 — авторы предлагают протокол оценки персональных LLM-агентов, основанный на временных вмешательствах и учёте состояния пользователя. В рамках анализа существующих бенчмарков не найдено ни...

Открыть материал →
Редакционная обложка COMRAD404: Copyright-Bench: новый бенчмарк для оценки соблюдения авторских прав LLM-агентами

Copyright-Bench: новый бенчмарк для оценки соблюдения авторских прав LLM-агентами

Исследователи представили Copyright-Bench — набор реалистичных коммерческих задач для проверки LLM-агентов на соблюдение авторского права. Тесты показали, что агенты часто выбирают защищённый контент, даже...

Открыть материал →
Редакционная обложка COMRAD404: Wmux — мультиплексор рабочих пространств для AI-агентов

Wmux — мультиплексор рабочих пространств для AI-агентов

На Hacker News появился анонс Wmux — инструмента, позволяющего запускать параллельно несколько AI-агентов (Claude Code, Codex, Gemini) в отдельных панелях, координировать их и сохранять...

Открыть материал →
Редакционная обложка COMRAD404: Правила для AI-агентов, чтобы не ломать работающий код

Правила для AI-агентов, чтобы не ломать работающий код

Проект claude-code-survival-kr предлагает набор правил и защитных файлов для Claude Code, Cursor и Codex, предотвращающих случайные поломки кода. Решение набирает обсуждение на Hacker News.

Открыть материал →