论文
超越正确性:面向有效性的生物医学大语言模型裁判评估
Beyond Correctness: Validity-Oriented Evaluation of Biomedical LLM Judges
摘要
我们提出了一个可扩展的、以有效性为导向的管道,用于在高质量的人类判断稀缺时评估生物医学LLM法官。首先,我们通过确定性的、基于度量的突变来增强现有的人类标记的生物医学基准,从而产生可审核的偏好对。其次,我们使用三个与部署相关的维度来评估总体正确性之外的判断:针对度量衍生的标准标签的正确性、重复随机采样下的稳健性以及对所请求的输出格式的符合性。我们使用此管道在四种制度下评估 Llama-3.1-8B-Instruct:(1)基础,按原样使用指令模型; (2) SFT,仅基于蒸馏的监督微调; (3) 仅基于 RL、GRPO 的强化学习; (4) SFT$\rightarrow$RL,SFT 后跟 RL。基础和单阶段制度在结构化医疗歧视(例如 PICO 提取和临床计算)方面表现不佳,而 SFT$\rightarrow$RL 在正确性、合规性和鲁棒性方面表现最佳;收益集中在可分解任务(PICO、MedCalc)上,有时匹配或超越前沿模型。
