Holtercare-Bench:多模态基准测试,推动长时动态心电图AI诊断新突破
多模态大语言模型(MLLMs)在医学图像解读和短时信号分析上已展现惊人能力,然而在动态心电图(ECG)这一关键领域,它们却面临严峻挑战。长时程心电数据不仅包含复杂的时间依赖模式,还要求模型具备精准的病理定位与诊断报告生成能力。近日,一支研究团队发布了 Holtercare-Bench,一个专门用于评估长时动态心电图分析能力的多模态基准,并配套推出了大规模数据集 Holtercare-23K,为这一领域的研究提供了全新标尺。
数据与基准:从788份临床记录中构建
Holtercare-23K 数据集包含 22,980 个问答对,源自 788 份临床 Holter 记录,并创新性地引入了信号-视频-文本三模态对齐机制。这种设计突破了以往静态图像或短时信号的局限,让模型能够同时理解心电波形、动态影像与临床文本描述,更贴近真实临床场景。
基于该数据集,Holtercare-Bench 从三个维度评估模型能力:时间定位(temporal localization)、临床诊断(clinical diagnosis)和全局总结(global summarization)。这意味着模型不仅要识别异常心拍,还要能定位异常发生的时间段,并生成完整的诊断报告。
零样本测试:主流MLLM暴露短板
研究团队对当前领先的 MLLMs 进行了零样本评估,结果令人警醒:在超长病理序列的处理上,现有模型普遍表现不佳,性能差距显著。这暴露出当前多模态模型在电生理学领域的深层缺陷——它们大多擅长静态图像或短时信号,面对长达数小时的心电数据,难以捕捉细微的时间依赖和病理演变。
微调带来显著提升
然而,研究并非止步于暴露问题。通过对代表性模型进行微调,模型的性能获得了大幅提升,证明 Holtercare-23K 数据集不仅可用于评测,更能作为训练语料,赋能模型掌握长时动态心电分析能力。这一结果也为后续研究指明方向:基于高质量临床数据的专项微调,是提升医疗 MLLM 实际应用价值的有效路径。
意义与展望
Holtercare-Bench 的发布填补了长时动态心电基准的空白,为医疗多模态大模型提供了基础性测试平台。未来,随着更多模型在此基准上迭代优化,我们有望看到 AI 在心律失常检测、心肌缺血预警等场景中发挥更可靠的作用,真正助力临床决策。
项目代码与数据已公开,研究者可访问项目主页获取详情。
