论文

令人震惊的简单自我回顾改进了没有 RL 的 Agentic 模型

Shockingly Simple Self-retrospection Improves Agentic Models Without RL

模型训练监督微调与指令调优

摘要

人们不仅通过重复成功的行动来学习,还通过叙述和解释他们的经历,修改他们的理解来指导未来的行为。语言模型Agent能否通过仅根据其自身经验的解释进行训练来改进其未来的行为?我们通过研究仅回顾微调(ROFT)来研究这个问题,这是一个最小的在线程序,旨在隔离仅解释训练对后续行为的影响。Agent尝试一项任务,观察可用的反馈,生成回顾性解释,并仅通过解释标记的下一个标记预测损失进行微调。该程序既不使用外部教师,也不使用基于奖励的策略更新。在 Qwen3.5-4B 的软件工程实验中,ROFT 接受了混合成功和不成功的基本模型尝试的问题的训练。在保留的 SWE-bench Verified 和 Pro 上,在不使用验证器的情况下进行 20 次更新后,它的解决率达到 49.2% 和 26.8%,而在评估运行中 40 次更新后,GRPO 的解决率分别为 48.0% 和 25.3%,并且在训练时间和采样尝试方面取得更快的早期进展。它还学习解决所有 64 个采样的基本模型尝试都失败的单个任务,这表明学习可以在没有任何最初成功轨迹的情况下开始。行为分析发现,ROFT 间接将功劳分配给行为,鼓励良好的行为并阻止错误的行为。此外,即使没有明确的长度惩罚,促使回顾强调更直接的解决方案也会产生更短的后续尝试。总之,这些发现表明,学习解释也可以改善学习做事,将自我生成的回​​顾建立为有用的培训目标,并激发对解释到行动迁移的进一步研究。