论文
Opera:长时域编码Agent的口头批评框架
Opera: A Verbal Critic Framework for Long-horizon Coding Agents
摘要
长期编码Agent需要及时纠正,但当反馈误判正在进行的工作或未能解决根本问题时,反馈可能无效甚至有害。现有的批评者专注于评估轨迹和生成反馈,但很少跟踪反馈后发生的情况。我们提出了 Opera,一个口头批评框架,它将每次纠正视为一个持久的注释,直到诊断出的问题得到解决。 Opera 决定何时通过定期和事件驱动的触发器进行审查,用类型化算子诊断问题,在交付前根据可见证据审核反馈,并跟踪Agent的后续操作以区分单纯的合规性和实际解决方案。作为测试时批评者,Opera 在四个策略模型中的 Terminal-Bench 2.1、SWE-Bench Pro子集和DeepSWE v1.1 上分别将非批评者Agent的解决率提高了 12.4、15.0 和 8.9 个百分点,并在所有三个基准上实现了竞争批评者基线中最高的平均解决率,并且on-policy批评本身时也改进了策略模型。除了推理之外,Opera 引导的rollout还提供了近似策略上的训练数据:对 Qwen3.5-9B 进行微调,可以将其在留出的SWE-Bench Pro仓库上的解决率提高了 10.2 个百分点,而在推理时没有批评,匹配对来自更强模型的rollout的微调,同时在切换Harness时保持其性能,即从 Openhands 到 Terminus-2,而来自更强模型rollout的微调在这种切换下明显退化。