论文
CER:在编码Agent执行结束前预测任务奖励
Before the Rollout Ends: Early Terminal Reward Prediction for Long-horizon Coding Agents
摘要
长时域编码Agent只有在完成昂贵的工具调用序列后才能获得可验证的奖励。这增加了推理成本,放大了早期的错误假设,并可能导致最终奖励稀疏和训练不稳定。我们引入了上下文早期奖励(CER),它通过轨迹前缀中的行为证据来预测最终奖励。 CER通过从相关历史任务中总结的经验,综合针对当前任务和阶段的适应性评价标准。在 SWE-bench Verified 上的测试时计算扩展中,CER 在 Nemotron 3 Ultra 上比最强基线提高了 RM@8 4.2 个百分点 (pp),在 Qwen 3.6 27B 上提高了 2.0 个百分点;在 Nemotron 上,只需 15.3% 的词元即可达到最佳基准性能。在 RL 训练实验中,CER 超过全面部署的 TMax 1.9 个百分点,同时使用的在线策略和判断词元减少了 52.7%。总之,CER 为长时域编码Agent提供了一种可解释、高效且密集的评估方法。