论文
环境作为支架:在长期任务中丰富引导自我进化代理的反馈
Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks
摘要
大语言模型 在静态推理方面表现出非凡的熟练程度,但通过强化学习(RL)将它们训练为自主代理来执行长期任务往往会受到严重奖励稀疏的阻碍。虽然通过有监督的 微调 (SFT) 进行传统的 \textit{agent 端预热}可以缓解这种情况,但它经常受到数据稀缺和探索受限的限制。为了解决这个问题,我们提出通过构建 \textbf{F}eedback-\textbf{E}nriched \textbf{E}nvironments (\textbf{FEEs}) 向 \textit{环境侧适应} 转变。通过试点研究,我们建立了一种反馈设计策略,通过在情节内探索和情节间演变的后期阶段从行动指导过渡到观察丰富来重新制定环境。使用各种 Qwen3 模型规模和 RL 算法(例如 GRPO、GSPO 和 DAPO)在 SciWorld 和 BFCL 基准上进行的大规模实验表明,FEE 始终比标准设置带来性能改进。此外,我们的分析表明,使用 FEE \textbf{(1)} 进行训练可以通过减少熵波动来稳定训练动态,\textbf{(2)} 有助于在困难任务中进行主动的状态空间探索,\textbf{(3)} 确保将环境指导内化为策略权重,而不是仅仅充当推理时间先验,并且 \textbf{(4)} 将组内反馈一致性视为稳定优化的关键边界。