论文

MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准

MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models

模型评测上下文与知识上下文工程记忆基准与评测资源Agent记忆

摘要

MedLoCoMo是一个面向跨多次住院医疗对话中患者特异性临床推理的医疗长上下文记忆基准。现有医疗问答基准大多测试短上下文知识或单文档溯源,而LLM能否使用、关联纵向患者病史并恰当拒答,仍是悬而未决的问题。我们基于去标识化的MIMIC-IV和MIMIC-IV-Note记录构建MedLoCoMo:构造住院级临床数据包,合成有据可依的医患对话,并生成与证据关联的问答项,覆盖单次住院、跨住院以及对抗性不可回答三类设定。该基准包含100条患者时间线,平均每次对话1669.8轮、29.7个会话、74512.2个token。在所评估的各基线中,跨住院推理始终难于局部证据使用,即使模型拥有长上下文窗口或采用外部记忆与检索方法也是如此。MedLoCoMo的代码与基准已发布于https://github.com/leozzy13/MedLoCoMo,供使用与复现。

MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准:论文配图
图 1:MedLoCoMo 中跨问题类型的选定模型性能的雷达图。轴报告可回答问题类型的大语言模型判断准确性和对抗性类型的弃权准确性。分数以 0-1 等级显示。