Тема

arxiv: статьи, новости и разборы

Статьи, новости и разборы по теме «arxiv»: ключевые события, понятные объяснения, практические материалы и проверенные источники COMRAD404.

В архиве 47 материалов

Материалы по теме

47 материалов
Редакционная обложка COMRAD404: DiSR: разделение 3D-восприятия и пространственных рассуждений

DiSR: разделение 3D-восприятия и пространственных рассуждений

Новый препринт arXiv предлагает DiSR — фреймворк, который разделяет 3D-восприятие и пространственные рассуждения: готовые модели восприятия строят структурированные 3D-данные, а LLM с LoRA рассуждает над ними без масштабного 3D-обучения.

Открыть материал →
Редакционная обложка COMRAD404: PRISM: как научить мультимодальные модели исполнять приоритизированные инструкции

PRISM: как научить мультимодальные модели исполнять приоритизированные инструкции

PRISM — четырёхэтапный синтез данных для обучения мультимодальных LLM следовать многошаговым рубрикам. На 10K примерах Qwen3-VL-4B вырос с 9,5% до 30,1% по строгой метрике...

Открыть материал →
Редакционная обложка COMRAD404: SearchAuditor: как находить и исправлять сбои длинных поисковых агентов

SearchAuditor: как находить и исправлять сбои длинных поисковых агентов

На arXiv вышел препринт SearchAuditor: авторы представили бенчмарк SearchAuditBench и фреймворк для локализации, атрибуции и исправления ошибок в длинных поисковых агентах.

Открыть материал →
Редакционная обложка COMRAD404: FinProBench: как оценивать финансовых ИИ-агентов по стандартам профессионалов

FinProBench: как оценивать финансовых ИИ-агентов по стандартам профессионалов

Препринт FinProBench предлагает строить рубрики оценки для финансовых ИИ-агентов на основе реальных профессиональных deliverables. Для узких ролей это заметно эффективнее обычных промптов.

Открыть материал →
Редакционная обложка COMRAD404: JudgeArena: единый фреймворк для оценки LLM-судей появился на arXiv

JudgeArena: единый фреймворк для оценки LLM-судей появился на arXiv

Препринт JudgeArena объединяет AlpacaEval, Arena-Hard, MT-Bench и m-Arena-Hard под единым интерфейсом со сменными судьями и логированием метаданных. Разбираем, что подтверждено, а что пока заявлено...

Открыть материал →
Редакционная обложка COMRAD404: Правильный ответ без правильной нормы: аудит юридических бенчмарков

Правильный ответ без правильной нормы: аудит юридических бенчмарков

Новый препринт arXiv (cs.CL): LLM верно отвечают на вопросы тайваньского бар-экзамена, но спонтанно ссылаются не на те нормы. Авторы предлагают оценивать ответ и правовое...

Открыть материал →
Редакционная обложка COMRAD404: Моделирование операционных задач с LLM: неопределённость и симуляция

Моделирование операционных задач с LLM: неопределённость и симуляция

Новая работа на arXiv предлагает training-free фреймворк для генерации математических моделей операционных задач с помощью LLM. Метод использует короткие симуляции для оценки промежуточных шагов...

Открыть материал →
Редакционная обложка COMRAD404: AgentMemBench: бенчмарк долгосрочной памяти агентов — внешнее хранилище обходит конкурентов

AgentMemBench: бенчмарк долгосрочной памяти агентов — внешнее хранилище обходит конкурентов

Новый препринт AgentMemBench сравнивает пять стратегий долгосрочной памяти для разговорных агентов на едином харнесе. Внешнее хранилище (EKV) лидирует по всем метрикам качества, но требует...

Открыть материал →
Редакционная обложка COMRAD404: Obshazard-bench: новый бенчмарк мультимодальных моделей для мониторинга катастроф

Obshazard-bench: новый бенчмарк мультимодальных моделей для мониторинга катастроф

На arXiv вышел препринт Obshazard-bench — бенчмарка для проверки мультимодальных LLM на сырых спутниковых потоках в задачах оперативного реагирования на катастрофы.

Открыть материал →
Редакционная обложка COMRAD404: TAPR: RL-переписчик промптов для LLM заявляет рост на Natural Questions и GSM8K

TAPR: RL-переписчик промптов для LLM заявляет рост на Natural Questions и GSM8K

Новый arXiv-препринт TAPR: отдельная модель на базе Phi-4-mini переписывает пользовательские промпты под задачу через GRPO и LLM-as-judge. Заявлен стабильный прирост точности, код открыт.

Открыть материал →