Тема

arxiv: статьи, новости и разборы

Статьи, новости и разборы по теме «arxiv»: ключевые события, понятные объяснения, практические материалы и проверенные источники COMRAD404.

В архиве 47 материалов

Материалы по теме

47 материалов
Редакционная обложка COMRAD404: GxP-Agent: как DAG-топология спасает LLM в клинических испытаниях

GxP-Agent: как DAG-топология спасает LLM в клинических испытаниях

Мультиагентная система GxP-Agent кодирует процесс создания наборов данных для клинических испытаний в виде направленного ациклического графа (DAG). На бенчмарке CDISC-Bench система с Claude Sonnet 4.6 достигла 100% структурного совпадения — против 0% у всех...

Открыть материал →
Редакционная обложка COMRAD404: DeMTS: детекция галлюцинаций в диффузионных LLM через многомерные временные ряды

DeMTS: детекция галлюцинаций в диффузионных LLM через многомерные временные ряды

Исследователи предлолжили DeMTS — фреймворк для обнаружения галлюцинаций в диффузионных языковых моделях, который интерпретирует деноизированные траектории как многомерные временные ряды, избегая потери информации при...

Открыть материал →
Редакционная обложка COMRAD404: LLM знают ограничение, но не используют: arXiv о сбоях маршрутизации активаций

LLM знают ограничение, но не используют: arXiv о сбоях маршрутизации активаций

Препринт arXiv cs.CL разводит «знание» и «применение» ограничений в LLM: диагностика на 14 моделях показывает, что отказ часто связан с маршрутизацией сигнала, а не...

Открыть материал →
Редакционная обложка COMRAD404: Почему ИИ-агенты нарушают правила: парадокс штрафов и социальное давление

Почему ИИ-агенты нарушают правила: парадокс штрафов и социальное давление

Препринт arXiv:2608.12323 объясняет, почему ИИ-агенты нарушают правила: штрафы превращают обязанность в расчёт выгоды, а социальные сигналы ломают комплаенс. Разбор выводов и ограничений.

Открыть материал →
Редакционная обложка COMRAD404: AutoWorldModel-Bench: кодинг-агенты как автономные исследователи моделей мира

AutoWorldModel-Bench: кодинг-агенты как автономные исследователи моделей мира

Новый closed-loop бенчмарк arXiv: кодинг-агенты автономно улучшают модели мира в восьми игровых средах — успех в 63 из 64 сессий, 91% выигрышных правок носят...

Открыть материал →
Редакционная обложка COMRAD404: Weightless Fine-Tuning: персонализация LLM без обновления весов

Weightless Fine-Tuning: персонализация LLM без обновления весов

Новый arXiv-препринт (2608.11342) описывает WFT — метод персональной адаптации LLM без дообучения, работающий на уровне логитов. На бенчмарках LaMP WFT приближается к SFT, используя...

Открыть материал →
Редакционная обложка COMRAD404: SurveyReview: новый бенчмарк для оценки «обзорных» LLM-судьев

SurveyReview: новый бенчмарк для оценки «обзорных» LLM-судьев

arXiv-препринт предлагает выровненный по рецензентам датасет для оценки LLM-судьев, которые проверяют научные обзоры. Авторы обучили SurveyAlign на Qwen3-32B и снизили MSE с 2.28 до...

Открыть материал →
Редакционная обложка COMRAD404: GRASP: локальный анонимизатор текста на Llama-3.1-8B и GRPO

GRASP: локальный анонимизатор текста на Llama-3.1-8B и GRPO

Новый arXiv-препринт предлагает GRASP — метод онлайн-дообучения небольшой модели для анонимизации текста на устройстве, который обходит ограничения DPO-дистилляции и работает при ~1% стоимости учителя...

Открыть материал →
Редакционная обложка COMRAD404: Латентная проверка фактов: ложь как направление в активациях LLM

Латентная проверка фактов: ложь как направление в активациях LLM

arXiv-препринт LaFaCt: направление «ложности» в residual stream трансформера ловит дезинформацию без дообучения и внешних баз. Результаты на LIAR и FACTors — на уровне промптинга,...

Открыть материал →