论文
具有自我蒸馏奖励塑造的代理强化学习
Agentic Reinforcement Learning with Self-Distilled Reward Shaping
摘要
智能体强化学习让LLM智能体通过交互学习,但稀疏的轨迹级奖励只能表明是否成功,难以确定哪些中间决策应获得信用。仅在训练时使用的特权技能可提供更密集的监督:让同一冻结策略快照,在给定任务对应操作技能的条件下,对不使用技能的固定轨迹词元重新评分。现有方法未同时完成跨步骤教师分数校准、教师置信度与实际回报关联,以及将这些信号接入原生奖励到优势的计算。本文提出自蒸馏奖励塑形的智能体强化学习框架ADRS,为多轮语言智能体构建与回报相关的词元级信用。ADRS在每个步骤内对特权词元分数进行中心化和归一化,再用基于组内置信度与回报关联的教师价值优势(TVA)门控调节,并将门控后的信号纳入原生强化学习信用分配。这些机制决定教师偏好、偏好与回报何时相关,以及如何进入强化学习,同时让执行轨迹采样与推理保持不使用技能。三个交互式基准上的实验显示,ADRS持续改善长程任务表现,收益在不同强化学习骨干、减少训练数据、未见任务和延长训练的设置下仍然存在。匿名评审代码见https://github.com/gitrxh/ADRS-arxiv。