论文
SKILLC:通过对比贡献归因学习LLM智能体的自主技能内化
SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment
摘要
结构化技能提示能改善长程智能体强化学习(RL)中的探索。技能增强的RL方法在推理时保留外部技能,而技能内化RL方法则在训练期间撤除技能以实现自主表现。然而,现有内化方法仅将技能有效性对比用于课程控制,策略更新保持不变,无法区分依赖技能的成功与自主成功。我们提出SkillC,一个基于对比技能贡献归因(CSCA)的框架,它将这种对比转化为内化的直接学习信号。SkillC在同一策略更新内,为来自活跃技能类型的任务采样成对的注入技能与无技能rollout,并通过双流优势估计器将其任务级对比注入优化,该估计器在保持全局排序的同时向无技能成功施加单侧校正。平滑的验证级信号进一步驱动对归因强度、rollout分配和单调活跃集剪枝的自适应课程。在ALFWorld和WebShop上的实验表明,在不访问运行时技能的情况下,SkillC分别超越此前最强的技能内化RL基线5.5%和4.4%,同时与技能增强RL方法保持竞争力。
