论文
面向智能体强化学习的轨迹相对事后蒸馏
Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning
摘要
近期智能体强化学习用事后信息补充稀疏结果奖励,但完整轨迹可提供许多信号,如何跨回合分配仍不明确。TRIAL采用统一的回合对齐评分协议:为每个决策提取实际结果视角,在普通与事后信息条件下评估同一响应。带符号的对数概率差决定词元监督的方向与局部强度,回合级幅度则沿完整实际轨迹联合归一化。分配乘数按合格词元加权后的均值为一,在固定平均强度的情况下跨回合重分配密集监督。WebShop与ALFWorld的不同骨干实验中,TRIAL在八组骨干、环境与指标组合上均优于GRPO,并在其中六组达到六种方法中的最好或并列最好表现。WebShop的Qwen3-1.7B成功率从56.4%升至75.2%,任务分数从78.7%升至85.7%。受控消融显示,轨迹相对的回合分配在密集事后蒸馏本身之外仍产生显著改善。