论文
我们的评分是否正确?了解医学基准中的故障模式
Are We Grading Properly? Understanding Failure Modes in Medical Benchmarks
摘要
医学评估正在从静态的基于选项的提问转向具有开放式输出模式的现实临床场景。然而,天真地按比例对这些进行评分是昂贵的,并且基于评分标准的评估已成为主要的可扩展替代方案。我们询问当规则本身不严密时会发生什么,以及是否可以检测到并纠正这些缺陷。我们将 RIFT(一种全球失败分类标准)应用于两个临床基准(HealthBench Professional 和 LiveMedBench),并发现失败模式是有意义的:在 HealthBench Professional 上,大语言模型法官将 29.6% 的标准标记为非原子标准,65.4% 的标准标记为错位/刚性。然后,我们证明这些缺陷是有意义的,而不仅仅是装饰性的。举例来说,将“以下至少一项/全部”形式的捆绑标准重写为同等权重的儿童,并对相同的回答进行重新评分,会使受影响的对话的分数变化高达 15.9 个百分点,其中分离捆绑会提高分数,而连接捆绑会降低分数。我们还发现,RIFT 通常检测不到临床评分标准上的捆绑,将 3.3% 的 LiveMedBench 标准标记为非原子,而表面形态分析发现 25.8% 为结构。