论文
LatentSkill:从上下文文本技能到 LLM 代理的权重潜在技能
LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents
摘要
代理系统越来越多地使用文本技能来编码可重用的任务过程,但在每一步将这些技能注入到提示中会产生大量的上下文开销,并将技能内容以明文形式公开。我们提出 LatentSkill,这是一个通过预训练的超网络将文本技能转换为即插即用 LoRA 适配器的框架。 LatentSkill 将技能知识存储在权重空间而不是上下文空间中,删除每步技能标记,同时保留模块化加载、缩放和组合。在 ALFWorld 和 Search-QA 上,LatentSkill 的性能优于相应的上下文技能基线,同时使用的预填充标记数量大幅减少:它在已见和未见的分割上将 ALFWorld 成功率提高了 21.4 点和 13.4 点,预填充标记平均减少了 63.9%,并将 Search-QA 精确匹配提高了 3.0 点,同时每步使用的标记减少了 71.8%。进一步分析表明,生成的技能 LoRA 形成结构化语义几何,可以通过 LoRA 缩放系数连续调制,并且可以在技能组件对齐时通过参数空间算法进行组合。这些发现表明,权重空间技能为扩展 LLM 代理提供了高效、模块化且暴露较少的基底。