论文

ClinTraceBench:基于 EHR 衍生对话的来源可验证的纵向临床推理

ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues

模型评测基准与评测资源

摘要

临床 LLM 助理必须对多次就诊的患者轨迹进行推理,但用于衡量这些轨迹的紧凑历史表示(检索、结构化时间线、LLM 摘要、主体记忆)是否保留了临床推理需求的纵向信号尚未得到测量。我们介绍 ClinTraceBench:385 个源自 MIMIC-IV 的经过验证的对话,具有事件 ID 来源、九任务分类法 (T1--T9) 和 L0--L4 确定性 + L5 人工审核验证(98.92% 一致性)。我们评估了八种历史表示策略——无上下文层、\textit{last-visit-only}、\textit{full-context}、BGE-M3 \textit{dense-retrieval}、两种压缩方案和两种代理记忆系统(\textit{Mem0}、\textit{A-Mem})——跨四个骨干网(DeepSeek-V3、GPT-4o-mini、Haiku~4.5、 Sonnet~4.6) 涉及 6{,}271 个问题:32 个单元,200{,}672 个预测。四个发现:(SP4)受控 T3 注入探针隔离了压缩引起的 \textit{relation} 损失——归因语句存在于 \textit{before} 构建、\textit{Mem0}、\textit{A-Mem} 和 \textit{LLM-summary} 仍然仅恢复了 0--5.3\% 的注入阳性; (SP1) 压缩策略对多次访问趋势和跨患者比较支付聚合税; (SP2) 盲注到满注的差距从 $+29.8$~pp (GPT-4o-mini) 到 $+62.7$~pp (Haiku); (SP3) 弃权与上下文长度非单调缩放。在帕累托边界上,俳句在 \textit{full-context} 下占主导地位(\$25.76 vs\\$106.21),颠倒了“最大骨干获胜”启发式。