论文
先定多少、再定何处:FACTOR面向多轮智能体强化学习的信用保持式动作到token分配
How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning
摘要
多轮智能体强化学习中的信用分配在两个层面进行:把轨迹级信用分配给动作,以及把每个动作的信用分布到其各个token上。本文提出FACTOR,将这两个决策分离。FACTOR使用检查点校准的TD残差为每个动作分配可逐项累加至轨迹优势的信用,并用反馈条件下的师生似然差将每份信用分配到已实现的动作token上。逐动作归一化保持了动作平均系数并防止token级符号翻转。我们将该构造与动作均值归约配对,消除动作标量代理权重对其token长度的隐式依赖。在行为策略处且在裁剪之前,每个动作的动作均值内层代理等于其TD信用。FACTOR在ALFWorld、WebShop与ScienceWorld上持续超越有竞争力的基线,所有环境-种子对比均有利于FACTOR,最大增益出现在最长程的环境中。同一组超参数无需重调即可迁移到更大的骨干与不同的模型家族。消融实验表明TD动作信用是改进的主要驱动因素,事后(hindsight)token分配贡献了互补增益。
