论文
LingLanMiDian:LLM 在中医药知识与临床推理上的系统评测
LingLanMiDian: Systematic Evaluation of LLMs on TCM Knowledge and Clinical Reasoning
摘要
大语言模型(LLM)在医学自然语言处理(NLP)中快速进步,然而中医药(TCM)具有独特的本体、术语与推理模式,需要忠于领域的评测。现有 TCM 基准在覆盖面与规模上碎片化,且依赖不统一的或以生成为主的评分方式,阻碍了公平比较。我们提出 LingLanMiDian(LingLan)基准,这是一个大规模、由专家策划、多任务的评测套件,将知识回忆、多跳推理、信息抽取与真实世界临床决策的评测统一起来。LingLan 引入了一致的指标设计、面向临床标签的同义词容忍协议、每个数据集 400 道题的 Hard 子集,并将诊断与治疗建议重构为单选式决策识别。我们对 14 个领先的开源与专有 LLM 开展了全面的零样本评测,为它们在中医常识知识理解、推理与临床决策支持方面的优势与局限提供了统一视角;关键的是,Hard 子集上的评测显示,当前模型与人类专家在中医专业推理上存在显著差距。通过标准化评测桥接基础知识与应用推理,LingLan 为推进中医 LLM 与领域专用医学 AI 研究建立了统一、量化且可扩展的基础。所有评测数据与代码可在 https://github.com/TCMAI-BJTU/LingLan 和 http://tcmnlp.com 获取。
