论文
CoEval:在没有标记数据或可信基准的情况下对自定义任务的语言模型进行排名
CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks
摘要
为特定应用选择预训练的语言模型或评估微调的语言模型是一项高价值的决策,但用于实现该模型的公共基准却不太合适:通用基准不需要反映特定的子域或子任务,并且当其项目泄漏到预训练中并被召回而不是解决时,其分数是值得怀疑的。我们提出了 CoEval,一个开放框架,它通过整体自我评估提供值得信赖的、特定于任务的信号:根据任务或领域描述,一组模型在教师、学生和法官这三个角色之间轮换,以生成一个新的、无污染的基准,回答它并相互评分,无需人工标签或评估者。因为每个模型也作为学生进行回答,所以响应是根据每个问题的判别力来衡量每个问题的数据,并根据与小组的共识来衡量每个法官的数据。在 真值 存在的情况下,CoEval 在 \r{ho}=0.86 处恢复真实排名并跟踪客观正确性,并且权重在 Spearman 0.95 处恢复 13 个模型的黄金排名。可靠性来自小组的组成,而不是规模:这种无标签的加权将不合格的法官归零,并降低了饱和问题的权重,因此两者都不会扭曲排名。生成的项目显示与五个公共基准的逐字重叠为零,该小组消除了冗长偏见并排除了同族自我偏好,并且排名是特定于领域的:三个不同的模型排名前四个从头领域,因此通用排行榜误导了大多数从业者。相同的管道在每个模型版本上重新运行,为任何团队提供其应用程序的无污染排行榜。