论文
SkillScriptBench:超越 Markdown 的可执行智能体技能包自演化基准
SkillScriptBench: Benchmarking Self-Evolution of Executable Agent Skill Packages Beyond Markdown
摘要
可执行 Agent Skills 将自然语言指令与脚本组合成 LLM 智能体可复用的包。修改这些包时,既要修复错误,也要保留原本正确的行为。现有自演化基准没有系统地区分文档修复、脚本修复及正确行为保留。我们提出包含 350 项任务的 SkillScriptBench,分别评价这些能力。通过调查超过 35,000 个 GitHub Skill 根目录,我们选出 100 个包,构造 150 项修复任务。每项任务将注入脚本错误的包、维护请求和所需行为的可执行检查配对。另一条受控轨道包含来自 50 个包的 200 项任务;每项任务在同一维护请求下,分别评估无错误、文档错误、脚本错误和两者均错四种状态。在四个 LLM 上,同时修改文档与脚本的方法能够修复脚本错误,但在文档修复或正确行为保留上,并不稳定优于只修改 Markdown 的方法。因此我们提出 AST-Guided Skill Revision,用抽象语法树及调用关系,把维护需求关联到相关代码位置;只在这些位置修改脚本,再更新文档以匹配修改后的脚本。跨模型平均,在错误包上,此修订阶段使 Raw Package 和 CoEvoSkills 的修复成功率分别绝对提高 21.9 和 27.7 个百分点。三次运行全部解决任务的比例,分别绝对提高 20.8 和 31.5 个百分点,说明重复运行中的修复成功更加一致。
