论文
引导,而不是解决:为大型代码代理训练小型批评家模型
Steer, Don't Solve: Training Small Critic Models for Large Code Agents
摘要
编码任务通常很复杂,需要多种能力,从高层规划到低层实施。虽然 编码智能体 针对联合功能进行了优化,但高层规划等单独功能可能具有不同的最佳值,并且仍然是主要瓶颈。为了应对这一挑战,我们训练了一个单独的批评家模型,该模型专门从事高级规划,以引导 编码智能体 进行推理。我们构建 SFT 和 DPO 数据来训练批评者模型,以识别 编码智能体 所犯的错误,并提供正确且清晰的高级指导,而无需生成具体行动。实验表明,我们微调的 4B 和 8B 批评模型显着提高了 6 个较大的 编码智能体 的性能(例如,在 SWE-Bench Verified 上将 GLM-4.7-Flash-30B-A3B 和 GPT-OSS-120B 的解析率提高了 16.0% 和 14.4%)。批评家模型还通过以更少的步骤解决任务来降低某些 编码智能体 的总推理成本(例如,将 GPT-OSS-20B 的每个示例推理成本从 0.07 美元减少到 0.03 美元)。代码:https://github.com/shubhamrgandhi/critic-training