论文
长期历史意识医学对话的综合和评估
Synthesis and Evaluation of Long-term History-aware Medical Dialogue
摘要
有效的医疗保健代理人必须能够回忆和推理患者的纵向病史。然而,缺乏具有现实的长期对话时间表的数据集限制了系统评估。真实的临床文本受到隐私和道德的限制,而现有的基准侧重于孤立的交互,未能捕获跨会话推理。我们引入了一个利用 LLM 综合高质量、长期医学对话的框架。我们的方法需要以知识为导向的分解为三个阶段:构建具有不同疾病和并发症轨迹的综合患者档案,每次相遇生成多轮对话,并将它们集成到连贯的纵向历史数据集 MediLongChat 中。我们建立了三个基准任务——对话推理、交叉对话推理和综合推理——来评估医疗保健代理的记忆能力。为了评估数据质量,我们引入了一个多维评估框架,将基于向量的指标与 LLM 法官评估相结合。具体来说,我们定义自动测量 - 忠实性、一致性和多样性 - 以及两个基于 LLM 的评估:正确性和现实性。基准实验表明,即使是最先进的 LLM 也难以应对 MediLongChat。这些发现强调了该基准的适用性,并强调需要定制方法来推进医疗机构的发展。