论文

VICT:利用验证器内部检查追踪长程智能体强化学习的信用分配

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning

模型训练强化学习Agentic RL

摘要

长程大模型智能体强化学习面临细粒度信用分配问题。标准目标通常把可程序验证的稀疏终局奖励分配给轨迹中所有动作。现有方法从采样轨迹构造辅助信号或额外比较来估计动作重要性,却往往仍把验证器简化为标量奖励,丢弃其内部任务结构。许多可验证任务的终局验证器已编码相关检查。VICT把可执行或有证据支持的原子检查项,通过满足依赖关系的有效证明边追溯到动作,仅沿这些边重新分配组相对优势,让信用分配从轨迹推断转向验证器追踪。该方法保留原始终局奖励,在证据不完整或不明确时不作分配,只改变训练时的优势张量;无需学习价值评估器、过程标签、分支采样或推理时访问验证器。ALFWorld和WebShop上优于仅用结果的训练,也与近期细粒度信用方法取得有竞争力的表现。消融排除密集原子奖励、最终提交动作信用、时间邻近性与稀疏性作为充分解释。