论文

TCMQA:包含 38000 个问题的中医基准和执业医师参考

TCMQA: A 38K-Question Traditional Chinese Medicine Benchmark with a Licensed-Practitioner Reference

模型评测基准与评测资源

摘要

语言模型的医学基准几乎完全建立在西方生物医学的基础上。中医(TCM)是一个独立的系统,有自己的诊断框架和自己的文献,而且在很大程度上仍然未经衡量。现有的少数中医评估规模较小、范围狭窄,而且很少与人类参考相结合。我们引入了 TCMQA,这是一个开放基准,包含来自中国中医执业资格考试的 38,279 个问题,以及来自 101 名执业医师的 15,151 条回答。我们评估了来自 9 个系列的 29 个指令调整模型,涵盖 0.27B 到 14.8B 参数。不同模型准确率相差超过59个百分点,并且没有模型接近饱和。预训练数据对中医能力的预测远好于规模:12B 西方预训练模型达到 39.6%,而规模仅为其八分之一的中文预训练模型达到 60.8%。九个模型超过了从业者多数票数的 64.9%,领先了 21.8 个百分点,而且所有九个模型都来自同一个中文预训练家族。然而,难度不会在模型和从业者之间转移:在从业者评定的难度中,准确性是持平的,所有 29 个模型的项目级一致性接近于零,并且在 $8.4\%$ 的项目上,从业者是正确的,而领先模型是错误的。我们在 https://huggingface.co/datasets/TechTCM/TCMQA. 发布语料库、执业者回答、Harness和逐题模型输出