Портрет автора Дарья Ким
COMRAD404 / AUTHOR

Дарья Ким

Редактор оперативной ленты

Дарья Ким ведёт оперативную ленту COMRAD404 и собирает сигналы из социальных платформ, каналов разработчиков и продуктовых сообществ. Её задача — быстро определить, где начинается новость и заканчивается пересказ чужого поста.

При подготовке публикаций сверяет первоисточник, время события, доступность функции и контекст обсуждения. Неподтверждённые детали в материалы не попадают.

оперативная лентасоциальные сигналыпродуктовые релизыпроверка источниковновости ИИ
188материалов

Последние публикации

LATEST
Голосовые модели и аудиоволна на фоне интерфейса инференс-платформы

Почему Fireworks не поддерживает Voice AI: гипотеза с Hacker News

На Hacker News обсуждают, почему инференс-платформа Fireworks не добавляет открытые голосовые модели. Автор считает, что инференс надо оптимизировать под сценарий, а спрос на Kokoro,...

Открыть материал →
Аудит юридических бенчмарков: правильный ответ и правовая норма расходятся

Правильный ответ без правильной нормы: аудит юридических бенчмарков

Новый препринт arXiv (cs.CL): LLM верно отвечают на вопросы тайваньского бар-экзамена, но спонтанно ссылаются не на те нормы. Авторы предлагают оценивать ответ и правовое...

Открыть материал →
Абстрактная иллюстрация фреймворка JudgeArena для оценки LLM-судей

JudgeArena: единый фреймворк для оценки LLM-судей появился на arXiv

Препринт JudgeArena объединяет AlpacaEval, Arena-Hard, MT-Bench и m-Arena-Hard под единым интерфейсом со сменными судьями и логированием метаданных. Разбираем, что подтверждено, а что пока заявлено...

Открыть материал →
Спутниковый снимок территории природной катастрофы с элементами анализа данных

Obshazard-bench: новый бенчмарк мультимодальных моделей для мониторинга катастроф

На arXiv вышел препринт Obshazard-bench — бенчмарка для проверки мультимодальных LLM на сырых спутниковых потоках в задачах оперативного реагирования на катастрофы.

Открыть материал →
Схематичное изображение долгосрочной памяти ИИ-агента

AgentMemBench: бенчмарк долгосрочной памяти агентов — внешнее хранилище обходит конкурентов

Новый препринт AgentMemBench сравнивает пять стратегий долгосрочной памяти для разговорных агентов на едином харнесе. Внешнее хранилище (EKV) лидирует по всем метрикам качества, но требует...

Открыть материал →
Схема uncertainty-aware inference для LLM в операционных задачах

Моделирование операционных задач с LLM: неопределённость и симуляция

Новая работа на arXiv предлагает training-free фреймворк для генерации математических моделей операционных задач с помощью LLM. Метод использует короткие симуляции для оценки промежуточных шагов...

Открыть материал →
график сравнения показателей китайских и американских AI моделей

Китай использует открытую модель против закрытых систем OpenAI — что говорят данные

На Reddit обсуждают, как Китай догоняет США в AI за счёт открытых моделей, патентов и публикаций. Разбираем, что подтверждено, а что остаётся гипотезой.

Открыть материал →
Схема работы TAPR: переписывание пользовательского промпта для улучшения ответа LLM

TAPR: RL-переписчик промптов для LLM заявляет рост на Natural Questions и GSM8K

Новый arXiv-препринт TAPR: отдельная модель на базе Phi-4-mini переписывает пользовательские промпты под задачу через GRPO и LLM-as-judge. Заявлен стабильный прирост точности, код открыт.

Открыть материал →