论文

检测智能体基准缺陷的自动化轨迹分析

Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks

模型评测评测方法与指标

摘要

前沿模型的能力常通过智能体基准来评估。要信任这些结果,基准必须准确测量其声称测量的东西,并且不存在使结果失效的缺陷。此前对SWE-Bench-Verified等基准的人工审计已在轨迹记录中发现若干效度问题。然而人工评审难以规模化,自动化方法能否可靠地揭示损害基准效度的缺陷也不清楚。本文开发了AI扫描器来检测四类效度问题:接触真值(ground truth access)、工具失效、可猜测漏洞与答案格式歧义。我们为每一类编制了评分细则以指导人工标注,并在Inspect Evals基准的留出测试集上对照人工标签评估扫描器。我们的扫描器在五个广泛使用的基准中发现了若干经证实的质量问题,其中包括随机人工抽查不太可能发现的案例。并非所有案例都被识别出来,且扫描器性能在基准、标准与模型之间差异显著。我们指出若干有待解决的开放挑战,以改进扫描器、支撑更强的质量保证声明,其中包括评估领域更广泛的标准缺失——它们会降低扫描器性能。总体而言,这些结果为更广泛地利用自动化轨迹分析来审计基准质量提供了概念验证。

检测智能体基准缺陷的自动化轨迹分析:论文配图
图 7:所有扫描仪的人工分级和扫描仪分级之间的混淆矩阵。