论文
SKILLER:面向小语言模型可复用技能提取的语言级强化学习
SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models
摘要
Agent技能是一种打包程序性知识与领域专长的标准化格式,在Agent harness系统中作为核心机制,持续约束语言模型的行为空间,以实现可重复、高质量的任务执行。然而,由于强闭源模型带来高推理成本,当前流行的Agent harness(如Codex和OpenClaw)在部署这些技能完成真实世界任务时仍然成本高得令人却步。可部署于消费级GPU的开源模型能力的快速提升,为通过基于技能的行为约束大幅降低这些成本提供了诱人机会。然而,自动生成专为这类紧凑模型定制的有效技能仍是一个重大的实践挑战。为此,我们提出SKILLER,一个自然语言驱动的强化学习框架,旨在自动为小模型生成执行者特定的技能:它以强模型为actor和critic,将小模型智能体系统视为环境,所有强化学习信号完全通过自然语言传播。使用Qwen3.5-9B和Qwen3.5-4B在五个相关基准上的广泛实验评估表明,SKILLER超越三种开源和一种闭源的技能生成或进化方法,9B模型取得4.3至20.4个百分点的绝对提升,4B模型取得1.8至13.3个百分点的提升,同时在SkillsBench的单技能任务上达到与强闭源模型相当的性能。项目已在https://github.com/DANG-ai/SKILLER发布。
