论文

从反思性经验中内化能动性

Internalizing Agency from Reflective Experience

模型训练监督微调与指令调优强化学习RLVR

摘要

大语言模型日益被部署为自主智能体,需要在长时程交互中与提供丰富反馈的环境进行规划、行动并从错误中恢复。然而,主流的结果驱动后训练方法(如带可验证奖励的强化学习)主要优化最终成功信号,使丰富的环境反馈未被充分利用。由此,它们常导致分布锐化:策略变得更擅长复现狭窄的一组已成功行为,却未能提升在长时程设定中扩展问题求解能力(如 Pass@k)所需的基于反馈的能动性。为解决这一问题,我们提出 LEAFE(Learning Feedback-Grounded Agency from Reflective Experience),一个从反思性经验中内化恢复能动性的框架。具体而言,在探索过程中,智能体将环境反馈总结为可执行的经验,回溯到较早的决策点,并以修订后的动作探索替代分支。随后我们通过监督微调将这些经验引导的修正蒸馏进模型,使策略在未来交互中能更有效地恢复。在固定交互预算下的多样化交互式编码与智能体任务上,LEAFE 相对基座模型一致地提升 Pass@1,并取得高于结果驱动基线(GRPO)与基于经验的方法(如 Early Experience)的 Pass@k,在 Pass@128 上增益最高达 14%。