论文
TestJack:您应该相信编码基准测试的结果吗? Agentic 通过 Evaluator Evolution 进行编码基准审计
TestJack: Should you trust the results in coding benchmarks? Agentic Coding Benchmarks Auditing via Evaluator Evolution
摘要
伴随着新代码基准的爆炸式增长,大型语言模型(LLM)代理正在迅速重塑软件工程。然而,几乎所有现有的基准仍然依赖于几十年前的相同标准:如果解决方案通过了一组固定的单元测试,那么它就是正确的。此类测试通常是不够的:它们仅检查任务所需的部分内容,因此代理可以奖励破解它们或默默地错过所需的行为,同时仍然通过每个测试。因此,较高的基准分数可能部分反映了对评估者更好的适应,而不是更好的问题解决能力。现有的工作侧重于静态测试增强:它们在看到任何试验之前对每个任务的测试进行一次强化,从而忽略了真正的试验实际上是如何失败的。我们推出 TestJack,这是一个可扩展的框架,用于评估固定测试之外的补丁。对于每次试验,TestJack 都会生成针对补丁可能违反的提示要求的测试,仅保留真实补丁通过的测试,并重新检查任何试验失败。因此,每个已确认的故障都由可重放的测试支持。减少评价 为了降低成本,我们还引入了一种轻量级变体,它可以深入审核试验的随机样本,并在同一任务的所有试验中重复使用结果测试。在 DeepSWE 和 SWE Marathon 等 6 个前沿模型后端和 5 个基准测试中,我们发现目前判断正确的模型试验中约有 34.4% 违反了任务要求,使总体解决率从 50.6% 降低到 33.2%。我们的结果揭示了当前编码代理评估的根本局限性:随着LLM在针对固定评估器进行优化方面变得更好,这些评估器本身必须变得更具适应性。