论文

Skill-to-LoRA:从使用技能到学习行为——面向省token的LLM智能体

Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

模型训练智能体系统参数高效训练Agent Skills

摘要

智能体技能常以SKILL.md文件分发:描述工作流、工具、资源与领域约定的人类可读程序性文档。虽便于检视与复用——该设计要求同一可复用过程被反复注入运行时上下文。我们提出Skill-to-LoRA(S2L)——以行为为中心的技能表示——用技能专属LoRA适配器取代运行时技能文本。S2L不压缩技能文档本身——而是建模技能文本诱导的行为改变:离线用完整SKILL.md合成技能引导示范;在线省略完整文档——动态加载对应LoRA适配器以激活习得的技能行为。我们以Qwen3.6-27B在SWE-Skills-Bench的21技能子集上评估S2L。较无技能与完整技能文本基线——S2L分别提升通过率2.9与5.2个百分点——同时较完整技能文本提示降低每步token成本6.6%。S2L在18/21技能上匹敌或超越完整技能文本——在15/21技能上超越无技能基线。对照实验进一步表明增益依赖技能专属适配器对齐:错误LoRA与共享LoRA都降低性能。这些结果表明许多程序性智能体技能可从运行时指令转换为可训练、可动态加载的行为模块。

Skill-to-LoRA:从使用技能到学习行为——面向省token的LLM智能体:论文配图
图 1:文本技能和 LoRA 技能表示。文本技能在每个代理步骤中保留提示、元数据和完整的技能主体。 LoRA 技能离线使用技能主体和演示,然后在运行时仅保留提示/元数据,同时将 LoRA 权重加载到模型上。