论文

ARBOR:通过可重复使用的 Rubric 缓冲区为搜索代理在线处理奖励

ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

模型训练奖励建模与过程监督

摘要

基于 LLM 的搜索代理主要通过仅结果奖励进行训练,使搜索过程本身不受监督。该信号在结果同质组上退化,其中所有采样轨迹都具有相同的正确性,产生零组内优势并且没有梯度。现有的流程监督要么训练成本高昂的验证程序,要么生成每个查询的规则,这些规则在查询之间不一致并在一次使用后被丢弃。我们提出了 ARBOR(Adaptive Rubric Buffer for Online Reward),这是一个可重用的流程奖励框架,可维护跨查询共享的 rubric 内存。从对比轨迹中得出的查询本地草稿被承认,合并到跨查询通用规则中,并随着策略的发展而退出。常见评分标准的一小部分活跃子集通过稀疏的成对判断对轨迹进行评分,并将所得分数添加到基本奖励中,即使结果奖励是统一的,也能提供过程级梯度。 ARBOR 在四个多跳 QA 基准上始终优于 GRPO 和 DAPO 基线,将平均 LLM 判断准确度提高了 4.2 个点,并将多达 42% 的零梯度训练组转换为信息丰富的训练组。