论文

用于长视野语言智能体可验证强化学习的政策条件反事实信用

Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents

模型训练奖励建模与过程监督

摘要

具有可验证奖励的强化学习可以改善推理和工具使用,但长期语言智能体仍然学习不受支持的证据链、信念漂移和满足终端检查的快捷操作。现有的流程奖励大多是相关的:它们奖励类似检索、反思或验证的步骤,而不估计该步骤是否有助于在指定干预下最终验证成功。我们提出了 CVT-RL,一种具有密集可验证奖励、干预有效性门控和策略条件反事实贡献(PCCC)估计器的约束策略梯度算法。删除、语义替换、证据替换和工具输出扰动定义了单独的受控干预措施;连续性是从冻结的参考策略中采样的,并且选择调整的双稳健估计器增强了优势。信念控制仅使用前缀可观察标签,而增强拉格朗日则限制不受支持的声明、跳过验证、工具篡改和不安全调用。在长上下文 QA、ALFWorld、ScienceWorld 和 Web/工具任务中,CVT-RL 将平均任务成功率从计算匹配的非因果 RL 的 71.8% 和信息匹配的反事实过程基线的 75.4% 提高到 78.9%,将证据 F1 从信息匹配的基线的 78.9 提高到 82.8,并将测量到的黑客行为从 7.2% 减少到3.9%。独立人工审计估计 CVT-RL 的黑客攻击率为 4.6%,而信息匹配基线的黑客攻击率为 8.1%,而自适应检测器规避攻击仅将黑客攻击率提高至 7.1%。对所有主要指标进行 Holm 校正后,分层引导和混合效应测试得出 p<0.01。仔细范围内的反事实信用,与有效性门控、诊断和可验证的约束相结合,为语言代理提供了一条可重复的路线,以实现更可靠的长期强化学习。