论文

LLM 修复代理中的验证证据:通过的内容中有多少实际上测试了错误?

Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?

智能体系统Agent任务评测

摘要

修复智能体运行测试并看到通过时,通常把结果当作针对报告缺陷的证据。本文衡量这种解释有多少确实成立。BSG-VA(错误状态、候选状态与标准修复的验证分析)记录每条验证命令对应的准确工作树状态,提取仅包含测试变更的补丁,并分别在原始错误代码B、候选状态S和开发者标准修复G上重放命令。依据原始和重放结果,为事件区分与标准修复一致的缺陷识别、仅回归验证或误导性证据。110个任务的643条执行轨迹共包含3730次事件;46.0%的可比较通过事件不含区分缺陷的信息;未注入反馈的基线轨迹中,23.8%在结束时,补丁的全部通过证据都属于这一类。三组实验检验将B重放结果反馈给智能体的效果。相较于注意力匹配的提醒,错误对照反馈使证据不足即结束的比例下降7.8个百分点(p=0.0029),缺陷区分证据增加7.4个百分点(p=0.011),未检测到修复成功率代价。两项效果均小于预设的10个百分点最小关注效应,因此实际幅度仍不确定。约三分之一改善来自提醒本身;改变运行框架和模型的两次探索性复现实验中,B重放内容仅在gpt-5.6-sol与不受约束工具调用循环的组合下产生可检测增量。只要保存必要代码状态和执行环境,BSG-VA就能事后用于可重放的修复轨迹。关键词:程序修复智能体、验证证据、测试充分性、大语言模型、软件质量、受控实验。