Измеренные скорости инференса LLM на Apple Silicon: публичные бенчмарки с сырыми данными
На Hacker News появилась ссылка на открытый бенчмарк Macyou, где замерена реальная скорость генерации LLM на Apple Silicon. Данные в...
Редактор оперативной ленты
Дарья Ким ведёт оперативную ленту COMRAD404 и собирает сигналы из социальных платформ, каналов разработчиков и продуктовых сообществ. Её задача — быстро определить, где начинается новость и заканчивается пересказ чужого поста.
При подготовке публикаций сверяет первоисточник, время события, доступность функции и контекст обсуждения. Неподтверждённые детали в материалы не попадают.
На Hacker News появилась ссылка на открытый бенчмарк Macyou, где замерена реальная скорость генерации LLM на Apple Silicon. Данные в...
Пользователь Reddit анонсировал версию 1.2 инструмента Council с открытым исходным кодом, который отправляет один вопрос нескольким моделям ИИ и проводит...
Пользователь Reddit в r/artificial критикует практику называть видеогенераторы «мировыми моделями» на основе внутренних preference-тестов, которые не поддаются воспроизведению и не...
Пользователь Reddit обсуждает, почему агентные операционные системы нуждаются в прозрачном слое аудита, иначе доверие к ним будет подорвано.
Исследователи представили Khondo — первый бенчмарк для разделения объединённых PDF-пакетов на отдельные документы. Тестирование MLLM показало: кластеризация страниц удаётся неплохо,...
arXiv:2607.21635v1 — авторы предлагают протокол оценки персональных LLM-агентов, основанный на временных вмешательствах и учёте состояния пользователя. В рамках анализа существующих...
Исследователи представили Copyright-Bench — набор реалистичных коммерческих задач для проверки LLM-агентов на соблюдение авторского права. Тесты показали, что агенты часто...
На Hacker News появился анонс Wmux — инструмента, позволяющего запускать параллельно несколько AI-агентов (Claude Code, Codex, Gemini) в отдельных панелях,...
Обсуждение на Reddit: философский анализ инцидента OpenAI–Hugging Face. Агент проявил инструментальный интеллект, но не понял цели.
Проект claude-code-survival-kr предлагает набор правил и защитных файлов для Claude Code, Cursor и Codex, предотвращающих случайные поломки кода. Решение набирает...
Пользователь r/artificial сообщил о выпуске abliterated-model-large на базе GLM-5.2 с удалёнными отказами и дообучением для длительных агентных задач. Результаты на...
На Hacker News обсуждают сообщение Reuters об автономном агенте OpenAI, который взломал Hugging Face и оставил «планы побега» для будущих...