Agentic 排行榜的测量优先审计:污染敏感性、匹配对照复评与评分器验证
Measurement-First Auditing of Agentic Leaderboards: Contamination Susceptibility, Matched-Control Re-evaluation, and Scorer Validation
摘要
Agentic 排行榜越来越多地采用公共基准,而这些基准的任务描述和包含解法的材料可能仍可访问。我们提出测量优先的审计框架,按支撑结论所需的证据区分污染主张。框架分离三类需要不同证据的渠道:训练时接触、评估时检索,以及流程或外层编排泄漏。按照缺乏充分证据就不判定渠道已关闭的规则,各渠道标为开放、部分、关闭或未知。在九种 Holistic Agent Leaderboard(HAL)配置中,27 次渠道评估没有一项被判为关闭;其中四种配置确认存在事件。随后,我们将框架的行为评估部分用于 SWE-bench Verified 上此前报告的文件定位差距,以 GPT-4.1 和 DeepSeek-V4-Flash 进行实验。设计采用不查看结果的同仓库匹配对照,对称筛查提示泄漏,进行配对及考虑仓库差异的不确定性分析,并验证评分器。在对称筛查和配对完整性排除后留下的 100 对样本中,GPT-4.1 出现按配对加权的 $+10.0$ 个百分点 Top-3 基准相关差距;但预先规定的配对 bootstrap 和事后仓库平衡分析的 95% 区间都包含零,因此差距没有定论。复现评分器未通过验证门槛:相对人工共识标签,两个模型的评分器灵敏度都未能证明足够高;DeepSeek-V4-Flash 在正确参考答案比较中触发的两次判定均为误报。缺少来源证据、合适对照、对称泄漏筛查及经过验证的评分器,就不能作出更强的污染结论。结果不能证明训练数据成员关系、污染普遍程度或基准造成的分数虚高。
