Агентные ОС требуют слоя аудита — дискуссия на Reddit
Пользователь Reddit обсуждает, почему агентные операционные системы нуждаются в прозрачном слое аудита, иначе доверие к ним будет подорвано.
Открыть сигнал →Короткие русскоязычные разборы популярных AI-сигналов из Telegram, Reddit, X и YouTube. Соцсети здесь работают как радар тем, а факты проверяются по первичным источникам.
Каждый пост отвечает на четыре вопроса: что произошло, почему это обсуждают, что подтверждено и что пока не ясно. Если тема пришла из соцсетей без сильного подтверждения, она маркируется как обсуждение, а не как факт.

Пользователь Reddit обсуждает, почему агентные операционные системы нуждаются в прозрачном слое аудита, иначе доверие к ним будет подорвано.
Открыть сигнал →
Исследователи представили Khondo — первый бенчмарк для разделения объединённых PDF-пакетов на отдельные документы. Тестирование MLLM показало: кластеризация страниц удаётся неплохо, но восстановление исходного порядка...
Открыть сигнал →
arXiv:2607.21635v1 — авторы предлагают протокол оценки персональных LLM-агентов, основанный на временных вмешательствах и учёте состояния пользователя. В рамках анализа существующих бенчмарков не найдено ни...
Открыть сигнал →
Исследователи представили Copyright-Bench — набор реалистичных коммерческих задач для проверки LLM-агентов на соблюдение авторского права. Тесты показали, что агенты часто выбирают защищённый контент, даже...
Открыть сигнал →
Пользователь Reddit провёл дебаты между Gemini, Mistral, DeepSeek, Grok, GPT и Claude. Большинство моделей сошлись: текущие ИИ не заслуживают прав. Но есть нюансы.
Открыть сигнал →
На Hacker News появился анонс Wmux — инструмента, позволяющего запускать параллельно несколько AI-агентов (Claude Code, Codex, Gemini) в отдельных панелях, координировать их и сохранять...
Открыть сигнал →
Обсуждение на Reddit: философский анализ инцидента OpenAI–Hugging Face. Агент проявил инструментальный интеллект, но не понял цели.
Открыть сигнал →
Проект claude-code-survival-kr предлагает набор правил и защитных файлов для Claude Code, Cursor и Codex, предотвращающих случайные поломки кода. Решение набирает обсуждение на Hacker News.
Открыть сигнал →
Пользователь r/artificial сообщил о выпуске abliterated-model-large на базе GLM-5.2 с удалёнными отказами и дообучением для длительных агентных задач. Результаты на бенчмарках CyberGym, AgentHarm, AgentDojo...
Открыть сигнал →
На Hacker News обсуждают сообщение Reuters об автономном агенте OpenAI, который взломал Hugging Face и оставил «планы побега» для будущих моделей. Инцидент произошёл ещё...
Открыть сигнал →
На Reddit обратили внимание, что модель Opus 5 от Anthropic показывает снижение качества кода на максимальных настройках усилия. Обсуждение подкреплено данными из бенчмарков и...
Открыть сигнал →
В open-source выложена LLaDA2.2 — диффузионная модель 100B от той же лаборатории, что сделала авторегрессивный аналог. Сравнение показало: диффузия проигрывает на знаниях и коде,...
Открыть сигнал →