论文
ExplainBench:评估代理的代码解释
ExplainBench: Evaluating Code Explanations from Agents
摘要
大语言模型 (LLM) 代理已在软件工程中得到快速采用。随着代理在实际代码生成中发挥更大的作用,他们正在做出更大的更改,跨越数十到数百行。这使得手动审查代理结果变得越来越不可行,导致开发人员转向解释来理解已实施的更改。尽管如此,仍然没有评估代理生成解释的可信度的基准。为了弥补这一差距,我们提出了ExplainBench,这是一个自动评估 编码智能体 解释的基准。 ExplainBench 基于这样的直觉:信息丰富的解释应该使 LLM 能够正确回答问题,从而允许对代理之间的解释质量进行定量比较。根据这一观察,我们构建了一系列问题,评估解释是否准确地描述了(1)有缺陷代码的预期行为以及(2)应用代理补丁本身的效果。实验首先表明,解释质量是智能体评估的一个独特轴:ExplainBench 对智能体的排名与广泛使用的 SWE-bench Verified 基准不同。对代理解释质量的更深入细分表明解释中经常出现问题,因此解释经常声称补丁是正确的,但实际上并不正确。基于这一见解,我们实施并评估了一个解释审计代理,该代理运行额外的测试来验证和完善解释。该代理改进了所有评估代理的解释,证明代理解释可以自动变得更加可信。