论文

使用大语言模型理解临床认知对话

Understanding Clinical Cognitive Dialogues Using Large Language Models

模型评测基准与评测资源

摘要

面对面的认知评估既是一种测试,也是一种互动。临床医生解释任务、纠正误解并适应患者的反应,而患者可能会犹豫、寻求澄清或脱离。然而,临床对话资源很少标注大规模研究这些行为所需的交互结构。我们提供了一个包含 33 个认知评估对话的去识别化语料库,其中包含 8,250 个针对三个说话者角色和 56 个对话行为进行注释的话语。我们使用该语料库对细粒度对话行为分类和下一个患者话语生成的大语言模型进行基准测试。我们还测试域外教学数据和解释增强训练是否转移到这种临床环境。指令调整可产生最强的患者话语参考匹配并提高分类准确性。推理感知微调可在 LLaMA-3.1-8B 变体中产生最强的分类结果。然而,即使是最好的模型也很难区分密切相关的对话行为,这表明广泛的对话意图比细粒度的交流功能更容易识别。语料库和基准使交互结构在认知评估中可测量,并支持对话标记、临床医生教育和仔细验证的模拟患者的后续工作。这项工作不做出诊断性声明。相反,它提供了研究这些应用程序所需的数据和评估框架。