论文
超越字面摘要:为医学SOAP笔记评估重新定义幻觉
Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation
摘要
评估大语言模型(LLM)在SOAP笔记生成等临床文档任务上的表现仍然充满挑战。与标准摘要不同,这些任务需要临床抽象、口语化语言的规范化以及有医学依据的推理。然而,包括自动指标和LLM即裁判(LLM as judge)框架在内的主流评估方法依赖词汇忠实度,往往把转录文本中未明确出现的任何信息都标记为幻觉。我们证明这类方法会系统性地把临床上有效的输出误判为错误,从而抬高幻觉率并扭曲模型评估。我们的分析揭示,许多被标记的幻觉实际对应正当的临床转换,包括同义词映射、检查发现的抽象化、诊断推理以及与指南一致的诊疗计划。通过校准提示和基于医学本体的检索使评估标准与临床推理对齐后,我们观察到结果发生显著变化。在词汇评估机制下,平均幻觉率为35%,对有效推理造成严重惩罚。采用推理感知评估后,这一数字降至9%,剩余案例反映的是真实的安全问题。这些发现表明,当前的评估实践过度惩罚有效的临床推理,度量到的可能是评估设计的伪影而非真实错误,凸显了在医学这类高上下文领域开展临床知情评估的必要性。
