论文

PAIR:面向多轮智能体优化的前缀感知内部奖励模型

PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

当前LLM的一大障碍是执行复杂的多阶段任务。组相对策略优化(GRPO)正成为主流选择,但其对稀疏结果奖励的依赖严重限制了跨中间步骤的贡献归因。现有补救手段,如运行完整rollout来分配步骤级优势、每一步调用外部LLM裁判、或计算需要每次评估都有真实答案的内在奖励,都会引入可观的成本或实际约束。我们假设,对LLM隐藏状态进行的内部正确性探测可以被重新用作步骤级奖励信号,从而有望一并解决上述所有局限。然而,现有探测研究假设输入是干净的,我们首先证明这一假设在多步设定下失效:隐藏状态探针在前缀污染下严重退化——它追踪的是与(可能已被污染的)前缀的一致性,而非有据的正确性;而基于注意力的特征对污染保持鲁棒,但在干净前缀上表现欠佳。基于这种互补关系,我们提出前缀感知内部奖励(PAIR),一个两阶段模型:冻结的隐藏状态探针估计信念一致性,轻量的基于注意力的头将其校正为有据的正确性。实验结果表明,PAIR在受污染轨迹上取得最高AUROC,同时推理成本可忽略不计,能够在无需外部模型调用、真实答案依赖或完整轨迹rollout的情况下,为GRPO训练提供密集的步骤级奖励信号。