论文
ATOD:面向多轮智能体任务的退火轮感知自策略蒸馏
ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks
摘要
训练面向长程交互任务的小语言模型智能体既需要快速模仿——也需要奖励驱动的改进。自策略蒸馏(OPD)提供密集教师引导——通常在早期快速提升——但其增益在学生接近教师后饱和——限制最终性能上限。强化学习(RL)直接优化环境奖励——鼓励朝更高奖励定义上限的探索性改进——但稀疏延迟的反馈使早期学习效率远低于OPD。本文提出ATOD(退火轮感知自策略蒸馏)——显式利用这种互补性的混合在线蒸馏算法。(1) ATOD采用退火的OPD-RL日程:OPD主导早期训练以逼近教师级行为——RL被逐步加强以驱动基于奖励的探索。(2) ATOD引入轮级分歧-不确定性重加权(T-DUR)——软门控蒸馏信号——优先长轨迹中分歧或不确定性高的轮次。ALFWorld、WebShop与Search-QA上的实验表明ATOD持续超越竞争性后训练基线:跨三个学生规模——ATOD较OPD提升平均成功率4.16分、较GRPO提升23.62分——并超相应教师模型2.16分。
