Запись архива

Новый бенчмарк Holtercare-Bench для оценки MLLM на длинных динамических ЭКГ

Исследователи представили Holtercare-Bench — мультимодальный бенчмарк для оценки MLLM на задачах с длительными динамическими ЭКГ. Набор данных Holtercare-23K включает 788 холтеровских записей с триплетным выравниванием сигнал–видео–текст. Модели показали существенный разрыв в обработке сверхдлинных патологических после

Редакционная обложка COMRAD404: Новый бенчмарк Holtercare-Bench для оценки MLLM на длинных динамических ЭКГ
Редакционная обложка COMRAD404: Новый бенчмарк Holtercare-Bench для оценки MLLM на длинных динамических ЭКГ
Редакционная тематическая обложка COMRAD404

Что произошло

На arXiv появилась статья Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis (авторы — ZJU4HealthCare, Китай). Работа предлагает два компонента: набор данных Holtercare-23K и одноимённый бенчмарк для мультимодальных больших языковых моделей (MLLM). Датасет содержит 22 980 пар вопрос-ответ, полученных из 788 клинических холтеровских записей — долговременных динамических ЭКГ длительностью от нескольких часов до суток. Важная деталь: применено триплетное выравнивание (сигнал–видео–текст), что отличает подход от обычных статичных медицинских изображений.

Почему это обсуждают

Большинство существующих медицинских MLLM ориентированы на статичные снимки или короткие временные ряды. Для холтеровского мониторирования, где критична временная динамика, качественных датасетов и бенчмарков не хватало. Holtercare-Bench заполняет эту нишу: он проверяет модели на трёх типах задач — временная локализация событий, постановка клинического диагноза по длинному сигналу и глобальное обобщение (суммирование всего периода наблюдения). Исследователи провели zero-shot тестирование популярных MLLM (например, GPT-4V, Gemini) и обнаружили значительное отставание при обработке сверхдлинных патологических последовательностей. После дообучения на Holtercare-23K показатели заметно выросли.

Что подтверждено и что остаётся неясным

Подтверждено наличие пробела: современные MLLM плохо справляются с долгосрочными электрофизиологическими данными без дополнительной адаптации. Дообучение даёт прирост — это воспроизводимый результат. Однако в статье не показано, как модели ведут себя на других длинных сигналах (например, ЭЭГ, акселерометрия). Все данные — от одного центра, требуется кросс-валидация на внешних наборах. Также неясно, насколько хорошо работают специализированные медицинские LLM, не включённые в zero-shot выборку.

Ключевые сведения

Punkt Detail
Датасет Holtercare-23K: 788 записей, 22 980 QA-пар, триплетное выравнивание
Задачи бенчмарка временная локализация, клинический диагноз, глобальное обобщение
Zero-shot существенный разрыв на сверхдлинных последовательностях
Дообучение значительное улучшение, код и модель обещают открыть

Что дальше

Репозиторий проекта на GitHub (github.com/ZJU4HealthCare/Holtercare-Bench) пока содержит минимальную информацию; обещаны скрипты для генерации датасета, веса модели и код оценки. Следить стоит за обновлениями. Для практического использования в клинических системах необходима независимая валидация и расширение на другие виды длинных физиологических сигналов.

Источники: оригинальная статья arXiv:2608.19297 (arxiv.org/abs/2608.19297). Верификационный код и обсуждение методологии — через GitHub Blog (github.blog).