论文
Gated-BEPO:面向大语言模型智能体的置信度门控Bellman信用分配
Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents
摘要
在长程环境中训练大语言模型智能体,需要把稀疏的终端结果信用分配到各个动作。现有的无critic方法将轨迹级奖励均匀传播到各步,而近期方法通过匹配重复状态构建步级组并在组内比较动作。前者无法区分失败轨迹中的有用动作与成功轨迹中的无效动作;后者依赖直接从单条轨迹结果导出的步级信用,以及与回合级信用的固定权重融合。我们提出Gated-BEPO,从经验rollout图中导出步级信用。对每个rollout组,Gated-BEPO构建经验图,并通过反映当前策略经验动作分布的平均回代Bellman不动点估计节点价值。随后用广义优势估计沿每条采样轨迹累积这些时间差分残差,得到同时捕捉即时与下游效应的步级Bellman优势。为自适应融合回合级与步级信用,置信度门控仅在具有多个已观测后继的状态纳入Bellman信用,否则使用回合级信用。在WebShop、ALFWorld和视觉Sokoban上的实验显示,该方法在语言与视觉语言模型上均带来一致提升;诊断性消融验证了Bellman不动点价值估计的有效性,并表明步级信用应被选择性地而非均匀地纳入最终优势。
