论文

验证视界:编码智能体奖励没有银弹

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

模型训练奖励建模与过程监督

摘要

一个经典直觉认为验证解比生成解容易。对今天的编码智能体——该直觉正被倒置:随基础模型发展更强推理能力、工程脚手架日益精巧——生成复杂候选解不再困难——可靠地验证它们已成为更难的问题。我们能构建的每个验证器都只是人类意图的代理——绝非意图本身。这使验证面临双重困难:第一——意图天然欠指定——使其本质上难以被忠实核查是否已满足;第二——模型训练期间——优化拉大代理与意图的差距——表现为奖励作弊或信号饱和。为此——我们沿三个维度刻画验证信号的质量——可扩展性、忠实性与鲁棒性——并论证同时取得三者是核心挑战。我们进一步研究四种奖励构造:通用编码任务的测试验证器、前端任务的量规验证器、真实智能体任务的“用户即验证器”——以及长程任务的自动化智能体验证器。跨不同任务类型与策略能力水平——我们对奖励设计的核心挑战及如何更有效利用奖励信号开展深入分析与实验。实验表明定向验证设计能有效抑制奖励作弊、提升任务完成质量——并在多个内部与公开基准上取得显著增益。这些经验共同指向一个核心观察:没有固定奖励函数能在策略能力持续增长时保持有效——验证必须与生成器共同演化。

验证视界:编码智能体奖励没有银弹:论文配图
图 1:训练期间策略模型和验证者之间的协同进化。验证者最初提供有用的奖励信号来指导政策改进。当策略超过验证者时,可能会发生奖励黑客行为。随后的验证者演变恢复了有效的指导,但这种指导可能再次饱和,需要进一步改进验证者以解锁下一阶段的政策演变。