论文

相同输出、不同参考:参考选择怎样改变多语言基准得分

Same Output, Different Gold: Measuring How Reference Choice Moves a Multilingual Benchmark Score

模型评测评测方法与指标

摘要

基准分数将系统输出与参考进行比较,方法论的注意力几乎完全集中在第一项上。我们测量第二个。个人身份信息的六种语言基准的保留标注记录包含两名独立标注者的标签、作为参考标准发布的聚合标签,以及独立专家重新标注样本所得的复核参考标准。使用它,我们可以固定得分输出并交换参考。一个输出的分数移动了 4.95 F1 点,另一个输出的分数移动了 2.00(95% CI [3.23, 6.27] 和 [0.26, 3.37]),最差语言的分数移动了 7.55。两个输出之间的比较也发生变化:参考和系统之间的配对交互为 +2.95 点(CI [+1.97,+3.87]),经受住了多次测试的校正,并改变了一种语言上的两系统优劣差距。原因是未记录的聚合默认值,当裁决未触发时,通常会保留一名标注者的标签,从而使发布的参考标准成为正在评分的输出的部分副本。我们报告了由此产生的参考敏感性区间,展示了如何从任何保留的注释记录中计算一个参考敏感度带,并认为应把这一量与基准分数一同报告。

相同输出、不同参考:参考选择怎样改变多语言基准得分的原论文方法或结果图
图 1:设计的注释管道:两次独立通过,第三次针对分歧,以及一个重新注释样本的审阅者池。实际上,第三遍跳过了一些分歧并涵盖了一些商定的提示(第 2 节)。这两份参考文献都是这一过程的输出。