论文
通过反思增强自我,学习难得成功但反馈丰富-蒸馏
Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation
摘要
使 大语言模型 (LLM) 能够从环境相互作用中不断改进是 后训练 的核心挑战。虽然 同策略 自 蒸馏 提供了一个有前途的范例,但现有方法主要将环境反馈视为被动调节信号。因此,他们严重依赖成功的示范,并努力在罕见的成功政权中学习。为了弥补这一差距,我们引入了反射增强型自我 蒸馏 (RESD),这是一个将原始故障反馈转化为纠正监督的主动来源的框架。 RESD 不是被动地附加反馈,而是通过生成回顾性反思来诊断局部错误来解释失败的轨迹,并策划一个持久的全局剧本以保留跨训练步骤的可重复使用的课程。即使在没有成功采样轨迹的情况下,丰富的上下文也使自学者能够提供可操作的 词元级 监督。对多个持续学习任务的实证评估表明,RESD 大大优于标准的自我 蒸馏 基线。此外,RESD 比 GRPO 实现了明显更快的早期改进,每个提示仅使用一次部署,只需 8 美元的样本,凸显了其卓越的交互效率。