论文

LLM智能体的生成技能组合

Generative Skill Composition for LLM Agents

智能体系统Agent Harness

摘要

最近的 LLM 代理受益于解决复杂任务的技能。技能封装了用于执行专门任务的程序知识和指令的模块化包,例如设置沙盒环境、运行测试套件或跨多个文件重构函数。随着技能库不断增长并可跨任务和领域重用,选择合适的技能组合已成为一个中心瓶颈。现有的方法分为两类。一个将智能体的推理暴露给整个技能集合;另一个通过嵌入或基于 LLM 的重新排序器执行技能检索。两者都提供了有用的见解;然而,他们忽视了技能构成的结构性本质,这是对哪些技能、多少技能以及以什么顺序排列的共同决定——这三个维度是无法分离的。我们将其形式化为结构化技能组合:给定一个任务和一个技能库,预测一个可执行的技能计划,该计划共同指定激活的子集、计数和执行顺序。我们提出了 SkillComposer,它将结构化技能组合实例化为任务条件技能序列预测。 SkillComposer 在技能标识符上使用约束自回归解码器,因此子集、计数和顺序从单个解码过程中共同出现,并且连续技能之间的依赖关系可以自然捕获。我们从真实的、人工管理的技能库中构建了一组任务组合对的训练集。然后,我们沿着两个轴评估 SkillComposer:保留测试集上的合成质量,以及 SkillsBench 上跨两个生产级 编码智能体 的下游任务成功情况。在 GPT-5.2-Codex、Gemini-3-Pro-Preview 上,SkillComposer 将通过率比无技能基线提高了 +23.1、+18.2pp,超过了前 3 名检索并以较低的提示词元成本匹配了标准技能检索上限。