论文

临床长上下文推理的抑制性注意:表征和减轻 EHR 处理中的“中间丢失”效应

Inhibitory Attention for Clinical Long-Context Reasoning: Characterizing and Mitigating Lost-in-the-Middle Effects in EHR Processing

上下文与知识上下文工程

摘要

现在,每位患者的电子健康记录通常超过 100,000 个词元。然而,大语言模型 表现出中间丢失 (LitM) 效应:长上下文中心附近的信息的检索可靠性低于边缘附近的信息。在临床使用中,这并不是良性的:笔记中最重要的一个事实可能位于其中心。我们将其称为临床中间迷失 (CLitM) 问题,使用 MedAlign 对其进行首次系统表征,并将上下文选择策略作为补救措施进行比较。在 2,196 个指令-响应对和六种语言模型中,我们观察到峰值准确度(59.5%、95% CI [46.3, 71.0]、20-30% 十分位数)和低谷准确度(70-80% 时为 37.6% [23.2, 52.5])之间存在 21.9 个百分点的差距; 67.8% 的参考答案位于 EHR 时间线的第 10 个和第 90 个百分位之间,位于 CLItM 低谷内。我们引入了查询条件临床抑制(QCCS),这是一种轻量级查询条件选择门,并针对 BM25、具有节头过滤、密集检索和跨编码器重排序(N=83 保留指令)的 BM25 对其进行了评估。使用 Qwen2.5-7B-Instruct(16k 上下文),QCCS 在 LLM 作为评判评分下优于所有五个比较器:对于中间位置指令,QCCS 达到 16.7%,而 BM25 为 3.3%,交叉编码器为 0.0%,密集为 0.0%,完整上下文为 6.7%;总体 QCCS 达到 25.3%,而仅检索比较器最多为 3.6%。这一优势无法通过检索召回来解释:在 k=20 时,BM25 在 98.8% 的指令中检索到了标注证据句子(QCCS 34.9%),但检索臂即使在检索到它时也最多保持 2.6% 的准确率,而 QCCS 即使在不检索时也能达到 25.0%。在这个概念验证评估中,与查询对齐的上下文选择比金句检索召回更好地预测 EHR 指令遵循的准确性。