论文
利用计算机化自适应测试对医学基准中的 大语言模型 进行成本效益评估
Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking
摘要
大语言模型 (LLM) 在医疗保健领域的快速普及迫切需要可扩展且心理测量学上合理的评估方法。传统的静态基准测试重复管理成本高昂,容易受到数据污染,并且缺乏用于细粒度性能跟踪的校准测量属性。我们提出并验证了一种基于项目反应理论(IRT)的计算机化自适应测试(CAT)框架,用于有效评估 LLM 中的标准化医学知识。该研究包括两个阶段的设计:蒙特卡罗模拟以确定最佳 CAT 配置,以及使用人工校准的医疗项目库对 38 LLM 进行实证评估。每个模型都完成了完整的项目库和自适应测试,该测试根据实时能力估计动态选择项目,并在达到预定义的可靠性阈值(标准误差 <= 0.3)时终止。结果表明,CAT 得出的熟练程度估算与全库估算实现了近乎完美的相关性 (r = 0.988),而仅使用了 1.3% 的项目。每个模型的评估时间从几个小时减少到几分钟,大大减少了词元使用和计算成本,同时保留了模型间的性能排名。这项工作建立了一个心理测量框架,用于 LLM 中基础医学知识的快速、低成本基准测试。所提出的适应性方法旨在作为标准化的预筛选和持续监测工具,不能替代现实世界的临床验证或以安全为导向的前瞻性研究。