论文

多模态模型对ECG信号的推理能力如何?

How Well Do Multimodal Models Reason on ECG Signals?

模型评测评测方法与指标

摘要

虽然多模态大语言模型通过生成可解释的推理轨迹,为健康AI的“黑箱”特性提供了有前景的解决方案,但验证这些轨迹的有效性仍是关键挑战。现有评估方法要么不可扩展(依赖临床医生人工审查),要么流于表面(使用QA等无法捕捉临床逻辑语义正确性的代理指标)。在这项工作中,我们引入一个可复现的ECG信号推理评估框架。我们提出把推理分解为两个不同的组成部分:(i)感知(Perception),即对原始信号中模式的准确识别;(ii)演绎(Deduction),即将领域知识逻辑地应用于这些模式。为评估感知,我们采用一个智能体框架生成代码,实证验证推理轨迹所描述的时间结构。为评估演绎,我们以基于检索的方式测量模型逻辑与结构化的既定临床标准数据库之间的对齐程度。这种双重验证方法实现了对“真实”推理能力的可扩展评估。

多模态模型对ECG信号的推理能力如何?
图1:ECG_ReasonEval 框架。我们将推理评估分解为两个独立的轴:(i) 感知(Perception),验证推理是否以信号为依据;(ii) 演绎(Deduction),评估逻辑是否符合临床共识。对于感知,我们采用一个灵活的数据科学智能体,动态编写并执行 Python 代码以验证具体发现。对于演绎,我们使用推理轨迹查询医学标准数据库,检查检索到的标准是否被打上与原始信号 ground truth 相同的标签。