论文
SKILL0:技能内化的情境主体强化学习
SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
摘要
代理技能、程序知识的结构化包和代理在推理时动态加载的可执行资源,已成为增强 LLM 代理的可靠机制。然而,推理时技能的增强从根本上是有限的:检索噪声引入了不相关的指导,注入的技能内容带来了大量的词元开销,并且模型永远不会真正获取它仅仅遵循的知识。我们询问是否可以将技能内化到模型参数中,从而实现零样本自主行为,而无需任何运行时技能检索。我们介绍 SKILL0,一个专为技能内化而设计的情境强化学习框架。 SKILL0 引入了训练课程,从完整的技能背景开始,然后逐步撤回。技能按类别离线分组,并通过交互历史记录呈现到紧凑的视觉上下文中,教授模型工具调用和多轮任务完成。然后,动态课程评估每个技能文件的 同策略 有用性,仅保留当前策略在线性衰减预算内仍能受益的技能文件,直到代理在完全零样本设置中运行。广泛的代理实验表明,SKILL0 相对于标准 RL 基线实现了实质性改进(ALFWorld 为 +9.7\%,Search-QA 为 +6.6\%,WebShop 为 +10.1\%),同时保持每步少于 0.5k 词元的高效上下文。我们的代码可在 https://github.com/ZJU-REAL/SkillZero 获取。