论文
代理基准中的双重测量混淆:去支架、真值 评分和超出平均值的可靠性
The Double Measurement Confound in Agent Benchmarks: De-Scaffolding, Ground-Truth Scoring, and Reliability Beyond the Mean
摘要
代理基准越来越多地用于比较 大语言模型 (LLM) 并指导部署决策,但基准分数只有在衡量模型功能而不是评估管道的属性时才有意义。我们发现了双重测量混淆:执行关键决策是由固定支架而不是模型执行的,而评分者使用可能无法反映任务正确性的标准来评估输出。我们将这些问题统一在一个测量理论框架内,该框架描述了基准分数何时可以被解释为模型能力的证据,并通过审计和修复协议将其实例化,该协议(i)将执行关键决策从脚手架转移到模型,(ii)用种子 真值 评分取代基于形状的评估,以及(iii)通过最坏情况和尾部风险指标报告超出平均值的可靠性。 ComtradeBench 上的实验表明,联合干预将几乎平坦的排行榜转变为可靠性谱,可区分种子的平均性能和鲁棒性。将审计应用于现有基准进一步表明,评分者有效性是特定于基准的,而无论我们在何处探索,脚手架所有权都是一个不受控制的轴。我们的结果表明,基准分数应与其脚手架水平、评分标准和可靠性概况一起解释,为更有效地评估 LLM 药物提供实用框架。