论文
SRPO:面向长视界推理的自反思策略优化
SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning
摘要
自反思是人类学习中一种强大的信用分配机制,能把稀疏的结果反馈转化为可操作的指导。然而,其在LLM后训练中的潜力仍未被充分探索。我们提出自反思策略优化(SRPO),一个将这一能力内化的框架。SRPO使LLM能分析自身已完成的轨迹,将错误综合为简洁的“反思补丁”,并在学生的on-policy rollout上使用以反思为条件的教师分数作为密集的token级训练信号。该过程有效将稀疏的终端监督转化为密集的token级学习信号,且无需外部批评家、独立奖励模型或更大的教师模型。我们证明SRPO以卓越的数据效率在数学推理与长视界Agentic基准上达到最先进性能。使用Qwen3-8B基座模型,SRPO仅用规模化监督微调所需训练FLOPs的8%(0.08x)即在AIME'24上达到73.3%,同时显著提升WebShop(64.7%)、ALFWorld(76.8%)和SWE-Bench-Lite(31.2%)的成功率。代码见 https://github.com/Galleons2029/SRPO。