论文
SkillGenBench:面向LLM智能体技能生成流水线的基准
SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents
摘要
随着LLM智能体越来越多地围绕可复用技能构建,核心挑战不再仅是智能体能否使用给定的技能,而是它们能否从代码仓库和文档中生成正确、可复用且可执行的技能。现有基准主要评估给定技能的效用,或智能体从原始上下文解决下游任务的能力,但并未把技能生成本身作为研究对象加以隔离。我们提出SkillGenBench,一个在统一且受控协议下评估技能生成流水线的基准。在SkillGenBench中,生成器接收原始语料并产出标准化的技能工件,随后在固定测试装置下执行,并以统一的评估流程加以评定。该基准涵盖两种生成模式:任务条件生成,即在任务揭晓后合成面向特定任务的技能;任务无关生成,即在下游任务未知之前必须蒸馏出可复用的技能库。它还覆盖两种互补的程序性知识来源:仓库锚定实例,其流程散布于代码、配置和脚本之中;文档锚定实例,其流程与约束须从长文本中蒸馏。我们提供标准化的任务规范、锁定版本的环境,以及以确定性执行检查为核心的评估协议,并辅以用于诊断的附加信号。在多种技能生成方法与骨干模型上的实验显示出显著的性能差异,凸显了可复用技能蒸馏的难度,并揭示了从软件仓库与从长文本生成技能的不同失败模式。SkillGenBench为把技能生成作为智能体系统中一个独立研究问题来研究建立了可复现的试验台。
