论文

基于提取轨迹的差异验证(GAVEL):将临床轨迹与病例报告进行对比

Grounded Adjudication of Variations across Extracted TimeLines (GAVEL): Comparing Clinical Timelines Against Their Case Reports

模型评测评测方法与指标

摘要

现有从病例报告中提取临床轨迹的流程依赖专家参考标注,受限于参考标注不完整和事件对齐不精确。我们开发了GAVEL,一种基于大语言模型(LLM)的评判协议,可对比两个轨迹与病例报告,为每处差异返回差异类型、判定结果及对应报告段落。我们评估了事件匹配器,审查了GPT5.6sol和DeepSeek V3.2产生的2,738项发现,对六种LLM提取器和两位人工标注者进行了排名,并测试了GAVEL引导的轨迹合并。在略低于和略高于0.10阈值的位置,真实匹配率分别为60%和48%。人工复核确认了89.4%和88.6%的发现。在126份报告中,合并后的轨迹在77.0%的对比中被优先选择(95% CI:69.8至84.1%),并将单份报告中归因于评估轨迹的差异数从7.63降至0.85。GAVEL支持基于报告的对比与修订,不将任一轨迹视为绝对正确。