论文

同策略 蒸馏 的信任区域行为混合

Trust-Region Behavior Blending for On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 根据从自己的策略中采样的前缀来训练学生,同时匹配更强的老师。这解决了离线 蒸馏 的前缀不匹配问题,但早期的学生轨迹采样仍然可能很差,将教师的监督置于较弱或低质量的前缀上。我们提出信任区域行为混合(TRB),这是一种预热方法,用以学生为中心的 KL 信任区域内最接近教师的行为策略取代早期轨迹采样策略,同时保持每个前缀反向 KL OPD 损失不变。 KL 预算退火至零,因此训练在热身后恢复为纯学生轨迹采样。在两种数学推理 蒸馏 设置中,TRB 在比较方法中获得了最强的平均值。