论文

UniSkill:为持续更新的策略学习有用的技能建议

UniSkill: Learning Actor-Aligned Skill Proposals for an Evolving Policy

模型训练智能体系统强化学习Agent SkillsAgentic RL

摘要

大语言模型Agent可以保留从先前交互中提炼的可复用技能,改善跨任务表现。近期研究联合优化任务执行与技能提取,使策略和技能库共同演化。然而,当Actor持续学习时,根据技能在后续训练中的复用效果奖励提案,会混淆技能收益与Actor自身进步;逐一直接测试技能又需要昂贵的额外Actor Rollout。本文提出UniSkill,使用共享策略与环境交互,并根据轨迹提出技能库编辑:添加、更新或不编辑。Actor从环境奖励学习,对比动作反馈则指导技能提案学习。该反馈衡量:用新技能替代检索技能,会怎样改变当前Actor在同一任务已有成功与失败轨迹之间的动作对数似然差距。它提供与Actor对齐的信号,避免为每个提案生成新Rollout。当提案内容评分较差时,提案级反馈可能压制本来适当的编辑操作,因此我们引入技能编辑支持正则化以保留探索。UniSkill在维持稳定联合训练的同时,在ALFWorld和WebShop上分别取得98.4%与84.7%的成功率。进一步实验显示,共享策略采用更小的骨干模型时,UniSkill在ALFWorld上仍然有效。实现见https://github.com/LimOkii/UniSKill。

UniSkill:为持续更新的策略学习有用的技能建议:论文原图
图 2:UniSkill 概述。 (1-2) 共享策略与环境交互,并根据结果轨迹提出编辑建议,而技能评论家则检查编辑的适当性和内容支持。 (3) 对比动作反馈测量参与者在固定轨迹上的对齐情况。 (4-5) 参与者和提议者目标共同更新策略。 (6) 符合条件的编辑更新技能库。