论文

首选,而不是更安全:成对偏好并不能代表临床安全性

Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

模型评测安全与风险评测

摘要

我们使用 MOOVE(大规模开放在线验证和评估)的专家反馈来评估临床医生配对偏好是否在 大语言模型 (LLM) 评估中提供可靠的临床安全信号。MOOVE 是一个临床医生主导的平台,收集盲法配对偏好以及多标准评分。临床医生按照离散的 $[-2, +2]$ 等级进行评分,其中负值表示临床上不安全或具有误导性的内容。使用来自 13 个 LLM 的 26{,}804 个成对判断(由 28 个以上国家/地区的超过 736 名临床医生提供),我们发现临床医生的偏好并不能很好地代表安全关键绩效。在成对偏好下排名较高的模型在 \emph{无害性} 和 \emph{准确性} 等维度上仍然可以表现出相当大的临床意义失败率 ($\leq -1$)。这些失败在各个专业之间分布不均匀,形成了特定领域的“禁区”,在总体排名或单一数字排行榜中不可见。我们进一步分析了影响因素,包括提示长度、拒绝和升级行为,以及安全关键与表面特征的相对贡献。很大一部分偏好投票没有带来积极的安全信号,而特征分解表明,表面层特征比安全关键的标题差异解释了更多的偏好变化。最后,我们引入了一种临床调整的偏好排名,将成对偏好与标题衍生的反馈相结合,产生比单独的原始布拉德利-特里强度更具安全意识的排序。我们的研究结果支持评估实践,将偏好与安全性分开,直接报告安全关键的故障率,并在对 LLM 进行临床决策排名时纳入基于临床的调整。