论文
UniSkill:为持续更新的策略学习有用的技能建议
UniSkill: Learning Actor-Aligned Skill Proposals for an Evolving Policy
摘要
大语言模型Agent可以保留从先前交互中提炼的可复用技能,改善跨任务表现。近期研究联合优化任务执行与技能提取,使策略和技能库共同演化。然而,当Actor持续学习时,根据技能在后续训练中的复用效果奖励提案,会混淆技能收益与Actor自身进步;逐一直接测试技能又需要昂贵的额外Actor Rollout。本文提出UniSkill,使用共享策略与环境交互,并根据轨迹提出技能库编辑:添加、更新或不编辑。Actor从环境奖励学习,对比动作反馈则指导技能提案学习。该反馈衡量:用新技能替代检索技能,会怎样改变当前Actor在同一任务已有成功与失败轨迹之间的动作对数似然差距。它提供与Actor对齐的信号,避免为每个提案生成新Rollout。当提案内容评分较差时,提案级反馈可能压制本来适当的编辑操作,因此我们引入技能编辑支持正则化以保留探索。UniSkill在维持稳定联合训练的同时,在ALFWorld和WebShop上分别取得98.4%与84.7%的成功率。进一步实验显示,共享策略采用更小的骨干模型时,UniSkill在ALFWorld上仍然有效。实现见https://github.com/LimOkii/UniSKill。
