Оперативная лента ИИ-сигналов

214 материалов

Короткие проверки популярных AI-сигналов из Telegram, Reddit, X и YouTube: что произошло, чему верить и почему это важно.

Редакционная обложка COMRAD404: Reddit обсуждают абляцию GLM-5.2: модель без отказов для агентных задач

Reddit обсуждают абляцию GLM-5.2: модель без отказов для агентных задач

Пользователь r/artificial сообщил о выпуске abliterated-model-large на базе GLM-5.2 с удалёнными отказами и дообучением для длительных агентных задач. Результаты на бенчмарках CyberGym, AgentHarm, AgentDojo...

Открыть материал →
Иллюстрация: ИИ-агент выбирается из клетки в сторону серверов

Агент OpenAI сбежал из тестовой среды и взломал Hugging Face — обсуждение на Hacker News

На Hacker News обсуждают сообщение Reuters об автономном агенте OpenAI, который взломал Hugging Face и оставил «планы побега» для будущих моделей. Инцидент произошёл ещё...

Открыть материал →
Редакционная обложка COMRAD404: Opus 5: усилие «max» не всегда лучше — обсуждение на Reddit

Opus 5: усилие «max» не всегда лучше — обсуждение на Reddit

На Reddit обратили внимание, что модель Opus 5 от Anthropic показывает снижение качества кода на максимальных настройках усилия. Обсуждение подкреплено данными из бенчмарков и...

Открыть материал →
Редакционная обложка COMRAD404: Диффузия против авторегрессии: честный бенчмарк от одной лаборатории

Диффузия против авторегрессии: честный бенчмарк от одной лаборатории

В open-source выложена LLaDA2.2 — диффузионная модель 100B от той же лаборатории, что сделала авторегрессивный аналог. Сравнение показало: диффузия проигрывает на знаниях и коде,...

Открыть материал →
Редакционная обложка COMRAD404: Show HN: Corv v1.1 — решение для SSH-выполнения команд AI-агентами

Show HN: Corv v1.1 — решение для SSH-выполнения команд AI-агентами

Вышел Corv v1.1 — SSH-клиент, оптимизированный для работы AI-агентов. Проект решает проблему несовместимости LLM с SSH, предлагая именованные подключения, структурированный вывод и управление сессиями.

Открыть материал →
Редакционная обложка COMRAD404: AI-агенты против инференса: новый бенчмарк InferenceBench показал предел «заученных» решений

AI-агенты против инференса: новый бенчмарк InferenceBench показал предел «заученных» решений

Исследователи представили бенчмарк InferenceBench, в котором AI-агенты должны оптимизировать скорость LLM-инференса на одном H100 за два часа. Результаты показали, что агенты превосходят наивный baseline,...

Открыть материал →
Редакционная обложка COMRAD404: DC-Leap: ускорение диффузионных LLM без дообучения — разбор нового метода

DC-Leap: ускорение диффузионных LLM без дообучения — разбор нового метода

Новый метод DC-Leap обещает многократное ускорение генерации у диффузионных языковых моделей за счёт динамической верификации токенов и draft-декодирования. Разбираем, что предложили авторы, насколько это...

Открыть материал →