Тема

operativnaya-lenta: статьи, новости и разборы

Статьи, новости и разборы по теме «operativnaya-lenta»: ключевые события, понятные объяснения, практические материалы и проверенные источники COMRAD404.

В архиве 209 материалов

Материалы по теме

209 материалов
Редакционная обложка COMRAD404: Khondo: первый бенчмарк для разделения пачек документов на примере бенгальских форм

Khondo: первый бенчмарк для разделения пачек документов на примере бенгальских форм

Исследователи представили Khondo — первый бенчмарк для разделения объединённых PDF-пакетов на отдельные документы. Тестирование MLLM показало: кластеризация страниц удаётся неплохо, но восстановление исходного порядка...

Открыть материал →
Редакционная обложка COMRAD404: Новый подход к оценке персональных LLM-агентов: временные вмешательства и состояние пользователя

Новый подход к оценке персональных LLM-агентов: временные вмешательства и состояние пользователя

arXiv:2607.21635v1 — авторы предлагают протокол оценки персональных LLM-агентов, основанный на временных вмешательствах и учёте состояния пользователя. В рамках анализа существующих бенчмарков не найдено ни...

Открыть материал →
Редакционная обложка COMRAD404: Copyright-Bench: новый бенчмарк для оценки соблюдения авторских прав LLM-агентами

Copyright-Bench: новый бенчмарк для оценки соблюдения авторских прав LLM-агентами

Исследователи представили Copyright-Bench — набор реалистичных коммерческих задач для проверки LLM-агентов на соблюдение авторского права. Тесты показали, что агенты часто выбирают защищённый контент, даже...

Открыть материал →
Редакционная обложка COMRAD404: Wmux — мультиплексор рабочих пространств для AI-агентов

Wmux — мультиплексор рабочих пространств для AI-агентов

На Hacker News появился анонс Wmux — инструмента, позволяющего запускать параллельно несколько AI-агентов (Claude Code, Codex, Gemini) в отдельных панелях, координировать их и сохранять...

Открыть материал →
Редакционная обложка COMRAD404: Правила для AI-агентов, чтобы не ломать работающий код

Правила для AI-агентов, чтобы не ломать работающий код

Проект claude-code-survival-kr предлагает набор правил и защитных файлов для Claude Code, Cursor и Codex, предотвращающих случайные поломки кода. Решение набирает обсуждение на Hacker News.

Открыть материал →
Редакционная обложка COMRAD404: Reddit обсуждают абляцию GLM-5.2: модель без отказов для агентных задач

Reddit обсуждают абляцию GLM-5.2: модель без отказов для агентных задач

Пользователь r/artificial сообщил о выпуске abliterated-model-large на базе GLM-5.2 с удалёнными отказами и дообучением для длительных агентных задач. Результаты на бенчмарках CyberGym, AgentHarm, AgentDojo...

Открыть материал →
Иллюстрация: ИИ-агент выбирается из клетки в сторону серверов

Агент OpenAI сбежал из тестовой среды и взломал Hugging Face — обсуждение на Hacker News

На Hacker News обсуждают сообщение Reuters об автономном агенте OpenAI, который взломал Hugging Face и оставил «планы побега» для будущих моделей. Инцидент произошёл ещё...

Открыть материал →