论文

AdaStep:智能体强化学习的自适应步级信用加权

AdaStep: Adaptive Step Credit Weighting for Agentic Reinforcement Learning

模型训练强化学习

摘要

长程LLM智能体通常以稀疏结果奖励训练,轨迹级目标过粗而无法区分个体决策的贡献。步级信用分配提供更细粒度监督,但其估计可能不可靠——观测回报也取决于后续动作、环境转移与轨迹长度。我们提出AdaStep,自适应步级信用加权方法:控制每个组导出的局部优势修改轨迹级信号的强度。我们把该加权表述为潜步优势的均方误差估计问题,并在显式条件采样假设下推导逐状态最优收缩系数;该系数可解释为信号占总方差之比——当回报变化可归于所选动作时保留局部信用,当变化由下游随机性主导时抑制它。AdaStep只需轻量标量计算,无评论家、无额外rollout、无额外模型推理。三个骨干在ALFWorld、WebShop与ScienceWorld上的实验显示以低计算成本一致超越基线。