论文

SkillGate:长程智能体中的策略内技能选择训练

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents

模型训练智能体系统强化学习Agent SkillsAgentic RL

摘要

智能体框架日益把程序性知识打包为技能:即智能体按需读取的指令文件,而公共技能库如今已持有数千个。读哪个技能因此成为策略在回合中途亲自做出的决策,但现有信号都无法训练它。我们证明默认补救办法——对候选技能集做结果奖励RL——无法教会它,原因是我们识别并命名为"选择器信用饥饿"的结构性问题:在广播式的序列级优势下,命名所选技能的少数token在损失中的份额趋近于零,且随着轨迹变长,它们继承的信用越来越常为错误符号。只要其后的执行失败,正确的选择也会被惩罚,即便该选择本就是轨迹中最有价值的决策之一。审计一次已完成运行自身的训练工件确认了全部三个性质,且每个都随horizon单调恶化。SkillGate从构造上消除该失败:它把token支撑集划分为两个不相交的信用通道——只到达执行token的结果信用,以及恰好到达技能命名token的独立动作局部优势,后者仅当轨迹中唯一一次读取为正确时为正。在16个候选技能集下的五个智能体基准上,SkillGate把9B策略的试次成功率从40.8%提升到53.2%,远超把同样预算只花在结果奖励上,同时把暴露于误导性候选的比例削减三分之二,并读取更少的技能。

SkillGate:长程智能体中的策略内技能选择训练:论文配图
图2:SkillGate概览。任务通道将终局结果组归一化为A^task,并在剔除整个读取调用后将其广播到执行token上;选择器通道用干净的单oracle效用为读取动作打分,并仅将A^sel置于身份token上。两个支撑集互不相交,且在应用λ之前每个通道的token权重之和为N;两者共同进入一次GRPO更新。