论文
潜伏 同策略 自我 蒸馏
Latent On-Policy Self-Distillation
摘要
让智能体能够从经验中学习并将其内化到他们的政策中已经成为自我进化人工智能的一个中心问题。 同策略 self-蒸馏 (OPSD) 通过使用特权自学教师对学生自己的轨迹进行密集监督,提供了一条有效的途径;然而,现有的方法仍然严重依赖于设计者指定的特权工件(例如答案、反馈、技能或轨迹),限制了持续自我改进所需的端到端可学习性和可扩展性。在这项工作中,我们引入了潜在的 同策略 Self-蒸馏 (LOPD),它不是提出另一种具有新规定形式的特权上下文的手工制作的 OPSD 变体,而是使教师的特权上下文本身可以从经验中端到端学习。从技术上讲,LOPD 检索相关经验并将其组合成连续的潜在标记,以限制自学教师的学习,而学生则根据任务和交互历史生成轨迹,并在每个访问的前缀处接收密集的 词元级 监督。我们进一步引入特权边际目标来稳定和调节潜在上下文的学习。根据经验,LOPD 展示了 (I) 强大的性能,在代理工具使用和代码生成方面均优于 RLVR 和代表性 OPSD 方法,包括 OPSD、SDPO 和 Skill-SD; (II) 学习效率高,以不到 30% 的轨迹采样预算超越了 GRPO 和 Skill-SD。消融研究进一步提供了直接证据,表明使特权背景可学习对于实现这些成果是必要的。总之,这些结果使 LOPD 成为迈向更具可扩展性和自我导向的代理进化范式的一步。