论文
多模态模型对ECG信号的推理能力如何?
How Well Do Multimodal Models Reason on ECG Signals?
摘要
虽然多模态大语言模型通过生成可解释的推理轨迹,为健康AI的“黑箱”特性提供了有前景的解决方案,但验证这些轨迹的有效性仍是关键挑战。现有评估方法要么不可扩展(依赖临床医生人工审查),要么流于表面(使用QA等无法捕捉临床逻辑语义正确性的代理指标)。在这项工作中,我们引入一个可复现的ECG信号推理评估框架。我们提出把推理分解为两个不同的组成部分:(i)感知(Perception),即对原始信号中模式的准确识别;(ii)演绎(Deduction),即将领域知识逻辑地应用于这些模式。为评估感知,我们采用一个智能体框架生成代码,实证验证推理轨迹所描述的时间结构。为评估演绎,我们以基于检索的方式测量模型逻辑与结构化的既定临床标准数据库之间的对齐程度。这种双重验证方法实现了对“真实”推理能力的可扩展评估。
