MS-Exam-Gen:用于评估文本多发性硬化症 MRI 知识的LLM的基于源的基准构建
MS-Exam-Gen: Source-Grounded Benchmark Construction for Evaluating LLMs on Textual Multiple Sclerosis MRI Knowledge
摘要
生物医学大语言模型 (LLM) 评估需要对狭隘的、不断发展的、基于来源的子专业知识进行可审计的评估。多发性硬化症 MRI (MS-MRI) 提供了高风险的文本知识测试用例,因为正确的推理需要当前的诊断标准、标准化采集和报告知识、纵向监测概念、病变形态以及对困难模仿的识别。我们提出了 MS-Exam-Gen,这是一个可重复的框架,用于构建和审核基于文本的多项选择问题 (MCQ) MS-MRI 知识基准;它不评估直接 MRI 图像解释。 MS-Exam-Gen 的目标是基于源的标准、协议、报告和鉴别诊断。该框架结合了专家来源索引、面向考试的主题归纳、基于证据的 MCQ 生成、自动质量审核、同族一致性筛选和经验校准。该管道从索引到 4,289 个检索块的 66 个源语料库中生成了一个锁定的 3,058 项候选基准,涵盖 16 个主题和 53 个子主题。对 12 个主要LLM端点的评估产生了 36,696 个项目级预测和超过 42.8 个百分点的准确度范围(89.7% 至 46.9%)的独立性能。在这些端点中,25.5% 的项目被至少四项遗漏。生成后的审计表明,更新的结构减少了可测量的答案线索,而选项顺序测试表明绝对 MCQ 分数仍然对位置敏感。生成的构造标签仍然是元数据,而不是经过验证的心理测量类别。由于专家裁决和完整的选项顺序平衡仍然是未来的工作,因此 MS-Exam-Gen 不是经过临床认证的检查。它应该被解释为自动过滤、基于源的候选基准和可重复的审核工作流程,用于项目级和特定主题的LLM评估。
