论文

Repo2Skill-Evo:仓库技能在无声中过时

Repo2Skill-Evo: Repository Skills Go Stale in Silence

智能体系统Agent任务评测Agent Skills

摘要

大语言模型(LLM)智能体日益在演进的软件仓库上运行,其成功依赖于仓库特定的程序性知识:该调用哪些API、该运行哪些脚本、以及当前发布版本期望哪些约定。智能体技能将这些知识外化为可复用单元,先前工作表明它们能提升智能体性能。尚不清楚的是这种提升是否持久。使技能有用的同一种版本特异性也使它脆弱:一次发布之后,技能可能在没有任何显式信号的情况下过时,同时继续提供过时的指导。因此,把知识外化为技能可能使其衰减变得不可见。我们研究智能体能否让这种外化知识保持最新。Repo2Skill-Evo将每次发布转换定义为一项技能维护任务:给定V1技能集和官方的V1到V2补丁,智能体必须更新过时的技能内容,同时保留仍然有效的指导。在57个真实仓库和105个精选发布转换上,每一个受评估的转换都使V1技能集部分失效。然而,六个前沿智能体在以补丁为根据的移除指标下(该指标平衡过时内容召回与过度编辑精度)仅达到29.9%-69.7%的avg@3宏F1。跨运行来看,两种相反的错误占主导:技能集中对受影响文件覆盖不全使过时内容原封未动,而过宽的编辑伴随更高召回但更低精度。仓库技能在无声中过时,即使前沿智能体也无法可靠地维护它们。

Repo2Skill-Evo:仓库技能在无声中过时:论文配图
图1:仓库技能的生命周期与 Repo2Skill-Evo 维护设置。Repo2Skill 将 V_{1} 仓库中特定于仓库的程序性知识提炼为可追溯的技能集。当仓库从 V_{1} 演化到 V_{2} 后,先前有效的技能内容可能悄然过时:它仍可加载、可检索,却持续提供与当前仓库状态不再匹配的指导。给定固定的 V_{1} 技能集和官方发布补丁,维护智能体产出更新后的技能集 𝒮_{V_2}。Repo2Skill-Evo 评估该智能体能否在保留仍然有效的指导的同时移除过时内容。