论文
MedMT-Bench:LLM能否记住和理解医疗场景中的长时间多轮对话?
MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?
摘要
大语言模型 (LLM) 在各个专业领域展示了令人印象深刻的能力,并已融入医学等高风险领域。然而,现有的医疗相关基准测试很少对实践中所需的长上下文记忆、干扰鲁棒性和安全防御进行压力测试。为了弥补这一差距,我们推出了 MedMT-Bench,这是一种具有挑战性的医学多轮指令,遵循模拟整个诊断和治疗过程的基准。我们通过专家手动编辑完善的逐场景数据合成构建基准,产生 400 个与实际应用场景高度一致的测试用例。每个测试用例平均22轮(最多52轮),涵盖5类难点指导问题。为了进行评估,我们提出了一个 LLM 作为法官协议,具有实例级规则和原子测试点,并根据专家注释进行了验证,人类与 LLM 的一致性为 91.94%。我们测试了 17 个前沿模型,所有模型在 MedMT-Bench 上均表现不佳(总体准确率低于 60.00%),最好的模型达到 59.75%。 MedMT-Bench 可以成为推动未来研究走向更安全、更可靠的医疗人工智能的重要工具。该基准可在 https://openreview.net/attachment?id=aKyBCsPOHB&name=supplementary_material 中找到