论文

BATON:轨迹内反馈归因与轨迹间目标归一化

Dual-Axis Policy Optimization for LLM Agents: Bayesian Feedback Attribution and Trajectory Mass Normalization

模型训练强化学习RLVRAgentic RL

摘要

LLM智能体强化学习涉及两个不同优化维度:如何在一条轨迹内利用环境反馈,以及如何跨批次聚合完整轨迹。我们分别将其表述为轨迹内反馈归因与轨迹间目标聚合,提出双轴策略优化框架BATON,即贝叶斯归因与轨迹目标归一化。第一个轴采用贝叶斯反馈归因,针对采样动作构建以反馈为条件的后验;第二个轴采用轨迹质量归一化TMN,为完整轨迹赋予相等的优化权重。在ALFWorld、WebShop和SearchQA中结合GRPO及GiGPO的实验显示,两轴均提供独立收益,组合后在不同模型规模上持续取得最强总体表现。

BATON:轨迹内反馈归因与轨迹间目标归一化:论文配图
图1:BATON的动机。平铺的Token级聚合给予长轨迹过多优化权重,因此需要将反馈归因与轨迹聚合分开处理。