论文

失败揭示指标遗漏之处:用于ECG分类器递归精炼的证据驱动智能体

Failures Reveal What Metrics Miss: An Evidence-Driven Agent for Recursive Refinement of ECG Classifiers

智能体系统Agent 环境交互

摘要

深度模型已大幅推进12导联心电图(ECG)分类,但其精炼仍严重依赖人类专家检查失败案例并迭代修订分类器设计。近期基于LLM的智能体展现了自动化模型设计的潜力,但若仅由聚合性能指标引导,它们缺乏对单个案例为何失败以及分类器应如何修订的洞察。我们提出RecursiveECG,一个证据驱动的LLM即设计者框架,LLM充当离线模型设计者,基于具体失败与客观ECG证据精炼ECG分类器。为使失败诊断落在可执行证据之上,标准到测量编译将精选的ECG诊断标准转换为经过验证的确定性函数,为单个ECG生成可复现、有参考依据的测量值。在这些测量基础上,证据支撑的失败审查通过联合考虑原始波形、测量值与模型输出,分析失败案例与对照案例,使LLM能够诊断分类器局限并制定有针对性的修订。候选修订在固定的问题契约下被执行并重新评估,只保留有证据支持的更新。精炼后的预测器被冻结,部署时无需LLM推理,同时审计轨迹将每个被接受的修订与其支持证据关联。在PTB-XL、Georgia与CPSC2018上,RecursiveECG持续优于强基线,取得平均10.0%的相对提升。大量消融与迁移研究进一步验证了其证据支撑精炼过程的有效性。

失败揭示指标遗漏之处:用于ECG分类器递归精炼的证据驱动智能体:论文配图
图 1. 动机示例,说明如何使用改进证据来分析心电图模型失败。