论文

ATOD:面向多轮智能体任务的退火轮感知自策略蒸馏

ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks

模型优化模型训练强化学习蒸馏RLVRAgentic RL

摘要

训练面向长程交互任务的小语言模型智能体既需要快速模仿——也需要奖励驱动的改进。自策略蒸馏(OPD)提供密集教师引导——通常在早期快速提升——但其增益在学生接近教师后饱和——限制最终性能上限。强化学习(RL)直接优化环境奖励——鼓励朝更高奖励定义上限的探索性改进——但稀疏延迟的反馈使早期学习效率远低于OPD。本文提出ATOD(退火轮感知自策略蒸馏)——显式利用这种互补性的混合在线蒸馏算法。(1) ATOD采用退火的OPD-RL日程:OPD主导早期训练以逼近教师级行为——RL被逐步加强以驱动基于奖励的探索。(2) ATOD引入轮级分歧-不确定性重加权(T-DUR)——软门控蒸馏信号——优先长轨迹中分歧或不确定性高的轮次。ALFWorld、WebShop与Search-QA上的实验表明ATOD持续超越竞争性后训练基线:跨三个学生规模——ATOD较OPD提升平均成功率4.16分、较GRPO提升23.62分——并超相应教师模型2.16分。

ATOD:面向多轮智能体任务的退火轮感知自策略蒸馏:论文配图
图 3:ATOD 概述。 (a) 退火指导从教师指导的引导转向奖励驱动的探索。 (b) T-DUR 利用分歧和不确定性来选择性地减弱低优先级转向。