论文

StepOPSD:用于代理强化学习的步骤感知在线偏好蒸馏

StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

模型训练强化学习Agentic RL

摘要

面向多轮智能体的强化学习存在贡献归因错配问题:奖励稀疏且处于轨迹层面,而成功往往取决于少数局部决策。现有在线策略蒸馏(online policy distillation, OPD)提供了更密集的token级监督,但通常将异构的智能体轨迹视为单一整体字符串,而非因果交互单元。我们提出StepOPSD,一个以智能体步骤作为信用重分配单位的rollout后偏好自蒸馏框架。StepOPSD将轨迹分解为以动作为中心的步骤片段,在事后信息增强的教师上下文中对其重新打分,并在GRPO更新之前将token级对数概率差距转化为保持符号的优势整形,每步采用归一化的信用预算。在基于Qwen3-1.7B与Qwen2.5-3B-Instruct的ALFWorld和Search-QA实验中,StepOPSD在对局部因果错误最敏感的子集上取得最优或次优结果,包括在ALFWorld Heat(79.1%)、PickTwo(95.0%)、Search-QA TriviaQA(61.6%)上排名第一,并在HotpotQA(40.4%)上并列最优。结果还揭示出一个一致的双旋钮规律:较小的α_clip充当具有广泛稳定作用的局部信任域,而最优的全局混合强度λ_mix则依任务而定。这些发现表明,当轨迹级奖励与决定下游成功的局部动作弱对齐时,步骤感知蒸馏最为有用。

StepOPSD:用于代理强化学习的步骤感知在线偏好蒸馏
图 1:StepOPSD 概述。 StepOPSD 将线上环境交互与线下信用塑造解耦。虽然基础 GRPO 推出动态保持不变,但推出后轨迹在结构上被解析为因果动作边界。通过在事后丰富的教师环境下重新评估这些孤立的跨度,StepOPSD 将token级别的偏好差距转化为 RL 优势的直接调制——注入密集的、步骤感知的监督,而不扭曲主要轨迹级别的奖励信号。