论文

SEAL:LLM 作为元法官能否恢复饱和基准?

SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

模型评测评测方法与指标

摘要

广泛使用的语言模型基准测试日益饱和,前沿系统经常获得标准指标无法解析的接近平分的分数。我们不是构建更难的替代方案,而是询问是否可以通过改进对相同候选输出的评估来使现有任务再次提供信息。因此,我们提出了使用自适应 LLM-as-a-Meta-Judge 进行种子消除,这是一种自我改进的评估协议,用于从饱和基准中提取潜在的排名信号。海豹突击队将候选人的输出种子化为单次淘汰,并根据任务级原则和自我改进清单标准评估每场比赛。我们在多个饱和基准上评估 SEAL,涵盖代码生成、数学推理、知识密集型问答和工具使用代理任务完成。在这些设置中,SEAL 改进了竞争协议的排名准确性和延迟权衡,通过完全成对判断获得 0.83--1.00 Spearman 协议和 4/4 top-1 协议,同时每个任务只需要 11.89 次调用,而完全成对评估需要 28.00 次调用。