论文
StepOPSD:用于代理强化学习的步骤感知在线偏好蒸馏
StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning
摘要
面向多轮智能体的强化学习存在贡献归因错配问题:奖励稀疏且处于轨迹层面,而成功往往取决于少数局部决策。现有在线策略蒸馏(online policy distillation, OPD)提供了更密集的token级监督,但通常将异构的智能体轨迹视为单一整体字符串,而非因果交互单元。我们提出StepOPSD,一个以智能体步骤作为信用重分配单位的rollout后偏好自蒸馏框架。StepOPSD将轨迹分解为以动作为中心的步骤片段,在事后信息增强的教师上下文中对其重新打分,并在GRPO更新之前将token级对数概率差距转化为保持符号的优势整形,每步采用归一化的信用预算。在基于Qwen3-1.7B与Qwen2.5-3B-Instruct的ALFWorld和Search-QA实验中,StepOPSD在对局部因果错误最敏感的子集上取得最优或次优结果,包括在ALFWorld Heat(79.1%)、PickTwo(95.0%)、Search-QA TriviaQA(61.6%)上排名第一,并在HotpotQA(40.4%)上并列最优。结果还揭示出一个一致的双旋钮规律:较小的α_clip充当具有广泛稳定作用的局部信任域,而最优的全局混合强度λ_mix则依任务而定。这些发现表明,当轨迹级奖励与决定下游成功的局部动作弱对齐时,步骤感知蒸馏最为有用。
