论文

自诱发结果潜力:在没有验证者的情况下对代理进行轮级贡献分配

Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers

模型训练奖励建模与过程监督

摘要

长视野 LLM 代理依赖于中间信息收集轮次,但通常仅在最终答案时观察训练反馈,因为过程级奖励需要高质量的人工注释。现有的回合级别塑造方法奖励增加黄金答案可能性的回合,但它们需要答案监督或稳定的特定于任务的验证器。相反,无标签强化学习方法从输出分布中提取自信号,但主要是在答案或轨迹级别,因此不能将功劳分配给中间回合。我们提出了自诱导结果潜力(SIOP),它将最终答案的语义集群视为基于潜力的回合级别贡献分配的潜在未来结果状态。对于每个查询,SIOP 对多条轨迹进行采样,将最终答案聚类为语义结果模式,并在这些状态上构建可靠性感知的目标分布。然后,它使用易于处理的集群级近似来奖励增加对可靠未来状态的后验支持。该目标将信息潜力塑造从黄金答案监督推广到没有特定任务黄金验证者的设置,同时避免了标准 GRPO 使用的广播采样轨迹级别优势。我们形式化了该框架,描述了其监督黄金答案限制,并表明 SIOP 在七个搜索增强代理推理基准上提高了无验证者结果水平基线的平均性能,同时接近黄金监督结果基线。代码可在 https://github.com/dl-m9/SIOP.git 获取。