BiPACE:针对 LLM 代理的双模拟引导策略优化和行动反事实估计
BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents
摘要
逐步基于组的 RL 是一种无需学习批评家即可训练长期 LLM 智能体的有吸引力的方法:它重复使用多条采样轨迹来估计局部优势。它的弱点不太明显,但更根本:每个组相关估计器都假设它比较的步骤对于贡献分配是等效的。我们表明,当前的代理变体通过状态-行动信用不匹配违反了这一假设。观察哈希分区在状态侧过于精细,创建了具有零步级信号的单例组,而单个组内平均值在操作侧过于粗糙,将状态值估计与特定于操作的信用混合在一起。我们引入了 BiPACE(Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation),这是一种直接的优势估计器,可以在不添加评价模型、辅助损失或额外采样的情况下修复双方。 BiGPO 集群在策略自身的隐藏状态几何中按余弦距离步进,这是一种经验策略诱导的互模拟代理,可大大降低观察散列留下的单例率。然后,PACE 使用以行动为条件的同伴基线来重新定位每个行为集群内的回报;它的 Q 风格实例以非参数方式估计局部 Q(s,a)-V(s)。在 ALFWorld/Qwen2.5-7B 上,BiPACE_Q 将三个种子的总体验证成功率从 GiGPO 的 90.8 提高到 $97.1\pm0.9$,并且每个种子都跨越了 95% 的阈值,这是 GiGPO 在相同预算内从未做到过的。在 Qwen2.5-1.5B 上,它达到 $93.5\pm1.2$,而 GiGPO 为 86.7,在 WebShop 和 TextCraft 上,它在两种模型规模上都比 GRPO 和 GiGPO 有所改进。测得的 BiPACE 特定开销是单个训练步骤墙时间的 11.3%。然而,它将估计器的比较单位从表面同一性改变为近似行为等价加上行动方反事实。代码可在 https://github.com/TianxiangZhao/BiPACE 获取。