论文

RewardHarness:自进化的智能体后训练

RewardHarness: Self-Evolving Agentic Post-Training

模型训练智能体系统强化学习奖励建模与过程监督Agent HarnessAgent SkillsAgentic RL

摘要

评估指令引导的图像编辑需要反映微妙的人类偏好的奖励,但当前的奖励模型通常依赖于大规模偏好注释和额外的模型训练。这就造成了数据效率的差距:人类通常只能从几个例子中推断出目标评估标准,而模型通常需要经过数十万次比较进行训练。我们提出了 RewardHarness,一个自我进化的代理奖励框架,它将奖励模型重新构建为上下文进化而不是权重优化。 RewardHarness 不是从大规模注释中学习,而是通过从少至 100 个偏好演示中迭代地发展工具和技能库,从而与人类偏好保持一致。给定源图像、候选编辑图像和编辑指令,协调器从维护的库中选择最相关的工具和技能子集,冻结的子代理使用它们构建产生偏好判断的推理链。通过将预测判断与真实偏好进行比较,并分析推理过程中的成功和失败,Orchestrator 可以自动完善其工具和技能库,无需额外的人工注释。仅使用 0.05% 的 EditReward 偏好数据,RewardHarness 在图像编辑评估基准上实现了 47.4% 的平均准确率,超过 GPT-5 5.3 个百分点。当用作 GRPO 微调的奖励信号时,RL 调整模型在 ImgEdit-Bench 上达到 3.52。项目页面:https://rewardharness.com。

RewardHarness:自进化的智能体后训练:论文配图
图 1:范式比较。传统范式收集大规模人类偏好数据,训练奖励模型,并将其用作 RL 对齐的奖励信号。相比之下,RewardHarness 从一小部分偏好演示开始,通过迭代评估和分析自我演化技能和工具库,从而产生可解释的奖励系统。