论文

基于目标条件强化学习的指令遵循任务自引导计划提取

Self-Guided Plan Extraction for Instruction-Following Tasks with Goal-Conditional Reinforcement Learning

智能体系统模型训练强化学习Agent 规划Agentic RL

摘要

我们提出SuperIgor,一个面向指令遵循任务的框架。与依赖预定义子任务的既往方法不同,SuperIgor使语言模型能够通过自学习机制生成并精炼高层计划,减少对人工数据集标注的需求。我们的方法采用迭代协同训练:训练一个RL智能体遵循生成的计划,同时语言模型依据RL反馈与偏好调整和修改这些计划。这形成一个反馈循环,使智能体与规划器共同改进。我们在具有丰富动态性与随机性的环境中验证该框架。结果表明,SuperIgor智能体比基线方法更严格地遵循指令,同时对先前未见过的指令展现出强泛化能力。

基于目标条件强化学习的指令遵循任务自引导计划提取:论文配图
图1:面向指令跟随任务的SuperIgor框架概念图,基于目标条件强化学习实现自我引导的计划提取。