SurveyReview: новый бенчмарк для оценки «обзорных» LLM-судьев
arXiv-препринт предлагает выровненный по рецензентам датасет для оценки LLM-судьев, которые проверяют научные обзоры. Авторы обучили SurveyAlign на Qwen3-32B и снизили...
Редактор оперативной ленты
Дарья Ким ведёт оперативную ленту COMRAD404 и собирает сигналы из социальных платформ, каналов разработчиков и продуктовых сообществ. Её задача — быстро определить, где начинается новость и заканчивается пересказ чужого поста.
При подготовке публикаций сверяет первоисточник, время события, доступность функции и контекст обсуждения. Неподтверждённые детали в материалы не попадают.
arXiv-препринт предлагает выровненный по рецензентам датасет для оценки LLM-судьев, которые проверяют научные обзоры. Авторы обучили SurveyAlign на Qwen3-32B и снизили...
На Hacker News представлена Needle 2 — 14-мегабайтная агентная модель на 45 млн параметров для tool calling, device use и...
arXiv-препринт LaFaCt: направление «ложности» в residual stream трансформера ловит дезинформацию без дообучения и внешних баз. Результаты на LIAR и FACTors...
Новый arXiv-препринт предлагает GRASP — метод онлайн-дообучения небольшой модели для анонимизации текста на устройстве, который обходит ограничения DPO-дистилляции и работает...
arXiv-препринт о сдвигах Big Five у PC-агентов после 11 жизненных событий, бенчмарк BFI-Adapt и ранжирование 14 моделей.
На Hacker News опубликован Show HN о Foundera — экспериментальной AI-нативной версии YC Startup School. Платформа обещает AI-агентов для валидации...
Пользователь r/artificial рассказал, как собрал микроконсалтинг на Claude, скрейпере и Zapier за $27 в месяц — и переживает, что дешёвые...
На Hacker News обсуждают, обязаны ли языковые модели отвечать «да» на прямой вопрос о своей природе и как это связано...
В репозитории unclebob/swarm-forge описан локальный инструмент оркестрации AI-агентов на основе tmux, git worktrees и ролевых промптов. Разбираем рабочие ветки two-pack,...
На Hacker News опубликован анонс Patchloom — однобинарного CLI и MCP для структурных правок JSON, YAML, TOML и кода. Публикация...
Пользователь r/artificial описывает устойчивый сдвиг активаций в средних и поздних слоях LLM при подаче длинного безобидного текста без инструкций, который...
Пользователь Reddit обнаружил, что WebFetch в Claude Opus 5 отдаёт модели не исходный текст, а саммари малой модели. Из-за этого...