论文

MedConceal:部分可观察性下临床隐忧推理的基准

MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability

模型评测基准与评测资源

摘要

患者与临床医生的沟通是一个信息不对称问题:除非临床医生巧妙地引出,否则患者通常不会透露恐惧、误解或实际障碍。因此,有效的医学对话需要在部分可观察性下进行推理:临床医生必须引起潜在的担忧,通过互动确认它们,并以指导患者接受适当护理的方式做出反应。然而,现有的医学对话基准在很大程度上回避了这一挑战,方法是暴露隐藏的患者状态,将启发分解为提取,或者评估响应而不对隐藏的内容进行建模。我们推出了 MedConceal,这是一个交互式患者模拟器的基准,用于评估医疗对话中隐藏问题的推理,包括 300 个精心策划的案例和 600 个临床医生与 LLM 的互动。每个案例均基于临床医生回答的在线健康讨论,将临床医生可见的背景与源自先前文献的模拟器内部隐藏的问题配对,并使用专家开发的分类法进行构建。模拟器向对话代理隐瞒这些问题,跟踪这些问题是否已通过基于理论的轮级通信信号揭示和解决,并经过临床医生的临床合理性审查。这使得能够对任务成功和导致任务成功的交互过程进行过程感知评估。我们研究两种能力:确认,通过多轮对话揭露隐藏的担忧,以及干预,解决主要担忧并引导患者制定目标计划。结果表明,没有一个系统占主导地位:前沿模型在不同的确认指标上领先,而人类临床医生 (N=159) 在干预成功方面仍然最强。总之,这些结果将部分可观察性下的隐忧推理确定为医疗对话系统尚未解决的关键挑战。