论文

SkillScriptBench:超越 Markdown 的可执行智能体技能包自演化基准

SkillScriptBench: Benchmarking Self-Evolution of Executable Agent Skill Packages Beyond Markdown

智能体系统Agent任务评测Agent Skills智能体自我改进长程任务评测

摘要

可执行 Agent Skills 将自然语言指令与脚本组合成 LLM 智能体可复用的包。修改这些包时,既要修复错误,也要保留原本正确的行为。现有自演化基准没有系统地区分文档修复、脚本修复及正确行为保留。我们提出包含 350 项任务的 SkillScriptBench,分别评价这些能力。通过调查超过 35,000 个 GitHub Skill 根目录,我们选出 100 个包,构造 150 项修复任务。每项任务将注入脚本错误的包、维护请求和所需行为的可执行检查配对。另一条受控轨道包含来自 50 个包的 200 项任务;每项任务在同一维护请求下,分别评估无错误、文档错误、脚本错误和两者均错四种状态。在四个 LLM 上,同时修改文档与脚本的方法能够修复脚本错误,但在文档修复或正确行为保留上,并不稳定优于只修改 Markdown 的方法。因此我们提出 AST-Guided Skill Revision,用抽象语法树及调用关系,把维护需求关联到相关代码位置;只在这些位置修改脚本,再更新文档以匹配修改后的脚本。跨模型平均,在错误包上,此修订阶段使 Raw Package 和 CoEvoSkills 的修复成功率分别绝对提高 21.9 和 27.7 个百分点。三次运行全部解决任务的比例,分别绝对提高 20.8 和 31.5 个百分点,说明重复运行中的修复成功更加一致。

SkillScriptBench:超越 Markdown 的可执行智能体技能包自演化基准的原论文方法或结果图
图 7:在四个骨干模型上,AST 引导修订都改善了参数绑定及辅助函数/恢复行为的修复。单元格显示三次运行的 In-the-Wild Avg(%);$N$ 为修复任务数。两个面板使用同一 0—100% 色标。