论文

TestPrism:重新思考超越单一参考的测试评估

TestPrism: Rethinking Test Evaluation Beyond a Single Reference

模型评测智能体系统Agent任务评测智能体自我改进评测方法与指标

摘要

大型语言模型 (LLM) 编码代理具有跨不同编程任务的高级测试生成功能。然而,根据单个参考解决方案评估测试的常见做法忽略了替代的有效实现,并且可能夸大了测试质量。我们引入了 TestPrism,其中包含来自 17 个来源的 300 个测试任务和 3000 个候选实现,均匀分布在有效和无效解决方案之间。其主要指标“联合成功函数”要求生成的测试在初始程序状态上失败,接受每个有效候选者,并拒绝每个无效候选者。在 14 种基线编码代理配置中,联合成功函数仅达到 28.00%,而单参考成功率达到 59.67%。我们的分析揭示了遗漏的行为、不受支持的断言和错误的测试构建。为了解决这些弱点,我们引入了 TestHelix,它将测试和修复对的异构合成与同行交叉验证和递归自我改进 (RSI) 结合起来。在两个模型中,TestHelix 将联合成功函数提高了 8.67 至 9.00 TestHelix 评估中相对于原生Harness比较器的百分点