论文

SKILLER:面向小语言模型可复用技能提取的语言级强化学习

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

智能体系统模型训练强化学习Agent SkillsAgentic RL

摘要

Agent技能是一种打包程序性知识与领域专长的标准化格式,在Agent harness系统中作为核心机制,持续约束语言模型的行为空间,以实现可重复、高质量的任务执行。然而,由于强闭源模型带来高推理成本,当前流行的Agent harness(如Codex和OpenClaw)在部署这些技能完成真实世界任务时仍然成本高得令人却步。可部署于消费级GPU的开源模型能力的快速提升,为通过基于技能的行为约束大幅降低这些成本提供了诱人机会。然而,自动生成专为这类紧凑模型定制的有效技能仍是一个重大的实践挑战。为此,我们提出SKILLER,一个自然语言驱动的强化学习框架,旨在自动为小模型生成执行者特定的技能:它以强模型为actor和critic,将小模型智能体系统视为环境,所有强化学习信号完全通过自然语言传播。使用Qwen3.5-9B和Qwen3.5-4B在五个相关基准上的广泛实验评估表明,SKILLER超越三种开源和一种闭源的技能生成或进化方法,9B模型取得4.3至20.4个百分点的绝对提升,4B模型取得1.8至13.3个百分点的提升,同时在SkillsBench的单技能任务上达到与强闭源模型相当的性能。项目已在https://github.com/DANG-ai/SKILLER发布。

SKILLER:面向小语言模型可复用技能提取的语言级强化学习:论文配图
图2:SKILLER概览。(a) 为紧凑模型量身定制的任务特定技能的自动生成与迭代精炼。在每个优化步骤中,框架接收一个目标任务实例和当前技能,将小规模LVLM智能体循环视为一个交互环境,以产生结构化状态四元组和标量奖励。在前沿模型的驱动下,critic结合回放记忆中的历史记录分析当前状态,评估执行结果、隔离因果错误并拟定修改建议,然后把这些诊断信息存回记忆。随后actor执行有界编辑操作来更新技能内容。关键在于,整个优化循环中的所有信息传递完全通过自然语言进行。(b) 随着底层技能在连续的优化步骤中不断进化与强化,小规模LVLM智能体循环的性能逐步提升。