论文
RLTL;DR:通过内化自我产生的反馈来自我完善
RLTL;DR: Self-improvement by Internalizing Self-generated Feedback
摘要
可验证奖励强化学习(RLVR)的常见做法是让Agent多次尝试任务,并朝成功轨迹优化。但在自我改进场景中,任务可能难到几乎无法成功,同时又没有教师模型或示例解答可供蒸馏。我们提出RLTL;DR:每次尝试失败后,将验证器输出展示给策略模型,让它生成一条简短的TL;DR洞见作为自己的反馈;随后以此前全部洞见为条件继续采样rollout,直到找到解答。我们还对上下文中的洞见反向传播,使模型内化从任务直接生成洞见的映射。在筛选至Pass@128=0的困难工具调用和编码数据集上,Qwen 3.5 9B Thinking策略的标准GRPO训练停留在0%至1%的Pass@1。RLTL;DR在训练中保留上下文洞见时达到14%至31%;更关键的是,评估时移除这些洞见后仍达到12%至13%。关键在于内化任务到洞见的映射。为进一步研究这一点,我们将方法简化为SFTL;DR,仅训练(任务,洞见)对,不展示任何rollout,也不对rollout反向传播。仅用4,000个这样的样本对,就恢复了RLTL;DR以及基于完整rollout的经典SFT的几乎全部性能。这提示一种紧凑的训练范式:“遇到这种任务时,记住这种要点”,有望启发后续研究。