论文

SKILLC:通过对比贡献归因学习LLM智能体的自主技能内化

SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment

模型训练智能体系统强化学习Agent SkillsAgentic RL

摘要

结构化技能提示能改善长程智能体强化学习(RL)中的探索。技能增强的RL方法在推理时保留外部技能,而技能内化RL方法则在训练期间撤除技能以实现自主表现。然而,现有内化方法仅将技能有效性对比用于课程控制,策略更新保持不变,无法区分依赖技能的成功与自主成功。我们提出SkillC,一个基于对比技能贡献归因(CSCA)的框架,它将这种对比转化为内化的直接学习信号。SkillC在同一策略更新内,为来自活跃技能类型的任务采样成对的注入技能与无技能rollout,并通过双流优势估计器将其任务级对比注入优化,该估计器在保持全局排序的同时向无技能成功施加单侧校正。平滑的验证级信号进一步驱动对归因强度、rollout分配和单调活跃集剪枝的自适应课程。在ALFWorld和WebShop上的实验表明,在不访问运行时技能的情况下,SkillC分别超越此前最强的技能内化RL基线5.5%和4.4%,同时与技能增强RL方法保持竞争力。

SKILLC:通过对比信用分配学习LLM智能体的自主技能内化:论文配图
图 1:Agentic RL 中技能使用范例的比较。 (a) 技能增强的 RL 方法使技能在推理时可用,并通过运行时技能支持优化性能。 (b) 技能内化强化学习方法在训练期间撤回技能,并可以估计技能对控制的帮助,但保持任务级别的学分分配不变。 (c) SkillC 将帮助性比较转化为自主成功的对比学分分配,同时通过验证驱动的课程调整归因强度、推出分配和主动技能集。