论文

LLM 代理训练的回顾性进度感知自我完善

Retrospective Progress-Aware Self-Refinement for LLM Agent Training

模型训练强化学习Agentic RL

摘要

经过强化学习训练的基于 LLM 的智能体可以优化逐步动作预测,但缺乏对任务进展的元认知意识,从而导致阻碍长期扩展的差距。一项试点研究表明,在线进步提示会损害绩效,而回顾性演示则有所帮助,但这种能力不能仅通过结果奖励训练来实现。我们提出了 RePro(回顾性进度感知训练),这是一个框架,训练智能体通过前向然后反思的采样轨迹范例自行生成进度信号:智能体在线执行操作,然后在给定完整轨迹和已知结果的情况下回顾性地重新评估其逐步进展。 RePro 通过回顾热身进行初始化,通过最少的外部演示来教授反射格式,然后通过 RePro-PO 进行进一步训练,并提供复合奖励,无需持续的外部监督即可产生自生成信号。 WebShop、ALFWorld 和 Sokoban 上的实验表明,RePro 增强了 Qwen 系列的性能,绝对成功率提升高达 $12\%$。