论文
终端Agent可以相信自己的验证吗?诊断和改进自我验证
Can Terminal Agents Trust Their Own Verification? Diagnosing and Improving Self-Verification
摘要
终端Agent在通过与命令行环境交互来解决任务时,依靠自我验证来评估和纠正其解决方案。然而,人们对这种自我验证的可信度仍然知之甚少。为了系统地研究这个问题,我们引入了一个诊断框架,该框架可以识别每个轨迹中的第一个完整解决方案,确定它是否客观正确,并使用这个基本事实来量化Agent的后续验证和恢复行为。将其应用到 TerminalBench2.1 上的 10 个终端Agent上,我们发现在形成完整的候选项后,验证几乎是普遍的,但只有 61.43% 的错误候选项被检测到,并且只有 49.36% 的检测到的错误被成功修复。这些结果表明,自我验证的主要弱点不在于发起验证,而在于检测和修复错误。受这些发现的启发,我们提出了学生条件验证蒸馏(SCVD),它让学生首先产生一个候选解决方案,并从相同的交互上下文中蒸馏出更强大的教师的后续验证和恢复。在三个 Qwen3.5 主干上,SCVD 在 TerminalBench2.1 上将 \textsc{Pass@1} 比相应的基础模型提高了 9.74--16.85 个百分点,比标准全轨迹蒸馏提高了 4.49--8.61 个百分点,同时避免了 SWE-bench Verified 上全轨迹蒸馏的明显分布外退化。