论文

编码智能体 作为测试套件审核员:在接近官方套件捕获的内容的同时查找官方套件遗漏的内容

Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch

摘要

在线法官判决以及基于其构建的数据集和基准被视为 真值,用于评估和训练 大语言模型 代码。然而之前的审计已经发出警告:官方套件接受有缺陷的提交。然而,这些审计仅止于警告,并没有提供任何实际的补救措施。我们的补救措施有两个部分:一个现成的 编码智能体,充当测试套件审核员,既构建对抗性测试套件以暴露官方套件遗漏的内容,又在不存在官方套件的情况下提供这些套件;认证链无需依赖官方法官即可确定每个代理标记的提交是否确实存在错误:多个独立编写的可接受的解决方案就每个测试的预期输出达成一致,强力解决方案解决分歧,并且每个问题的验证器都会验证每个失败的输入是否合法。其中一位代理在 AtCoder 的 20,375 份已审核已接受提交中识别出 589 份已验证已接受但存在缺陷的提交;将相同的认证扩展到所有五家代理商,联盟底线将达到 906 份此类提交。五个代理分别评分,每个代理在官方套件捕获的逻辑错误覆盖范围内保持在 1.7 个百分点以内。对于没有可用官方套件的截止后 Codeforces 问题,相同的测试构建方法在每个测试的输入预算中引导所有五个再现的基线。如果存在官方套件,代理会审核套件的充分性而不是假设它;如果不存在,代理套件会捕获我们复制和测试的方法中最有错误的提交。