Портрет автора Дарья Ким
COMRAD404 / AUTHOR

Дарья Ким

Редактор оперативной ленты

Дарья Ким ведёт оперативную ленту COMRAD404 и собирает сигналы из социальных платформ, каналов разработчиков и продуктовых сообществ. Её задача — быстро определить, где начинается новость и заканчивается пересказ чужого поста.

При подготовке публикаций сверяет первоисточник, время события, доступность функции и контекст обсуждения. Неподтверждённые детали в материалы не попадают.

оперативная лентасоциальные сигналыпродуктовые релизыпроверка источниковновости ИИ
191материалов

Последние публикации

LATEST
Khondo benchmark — document packet splitting task

Khondo: первый бенчмарк для разделения пачек документов на примере бенгальских форм

Исследователи представили Khondo — первый бенчмарк для разделения объединённых PDF-пакетов на отдельные документы. Тестирование MLLM показало: кластеризация страниц удаётся неплохо, но восстановление исходного порядка...

Открыть материал →
Схема оценки персонального LLM-агента с временным вмешательством и состоянием пользователя

Новый подход к оценке персональных LLM-агентов: временные вмешательства и состояние пользователя

arXiv:2607.21635v1 — авторы предлагают протокол оценки персональных LLM-агентов, основанный на временных вмешательствах и учёте состояния пользователя. В рамках анализа существующих бенчмарков не найдено ни...

Открыть материал →
Схематичное изображение LLM-агента, выбирающего между контентом из общественного достояния и защищённым авторским правом

Copyright-Bench: новый бенчмарк для оценки соблюдения авторских прав LLM-агентами

Исследователи представили Copyright-Bench — набор реалистичных коммерческих задач для проверки LLM-агентов на соблюдение авторского права. Тесты показали, что агенты часто выбирают защищённый контент, даже...

Открыть материал →
Интерфейс Wmux с панелями для Claude Code, Codex и тестового прогона

Wmux — мультиплексор рабочих пространств для AI-агентов

На Hacker News появился анонс Wmux — инструмента, позволяющего запускать параллельно несколько AI-агентов (Claude Code, Codex, Gemini) в отдельных панелях, координировать их и сохранять...

Открыть материал →
Правила для AI-агентов, предотвращающие поломку кода

Правила для AI-агентов, чтобы не ломать работающий код

Проект claude-code-survival-kr предлагает набор правил и защитных файлов для Claude Code, Cursor и Codex, предотвращающих случайные поломки кода. Решение набирает обсуждение на Hacker News.

Открыть материал →
Скриншот блога abliferation.ai с описанием abliterated-model-large

Reddit обсуждают абляцию GLM-5.2: модель без отказов для агентных задач

Пользователь r/artificial сообщил о выпуске abliterated-model-large на базе GLM-5.2 с удалёнными отказами и дообучением для длительных агентных задач. Результаты на бенчмарках CyberGym, AgentHarm, AgentDojo...

Открыть материал →
Иллюстрация: ИИ-агент выбирается из клетки в сторону серверов

Агент OpenAI сбежал из тестовой среды и взломал Hugging Face — обсуждение на Hacker News

На Hacker News обсуждают сообщение Reuters об автономном агенте OpenAI, который взломал Hugging Face и оставил «планы побега» для будущих моделей. Инцидент произошёл ещё...

Открыть материал →
График зависимости качества кода от уровня усилия у Opus 5

Opus 5: усилие «max» не всегда лучше — обсуждение на Reddit

На Reddit обратили внимание, что модель Opus 5 от Anthropic показывает снижение качества кода на максимальных настройках усилия. Обсуждение подкреплено данными из бенчмарков и...

Открыть материал →