论文
Repo2Skill-Evo:仓库技能在无声中过时
Repo2Skill-Evo: Repository Skills Go Stale in Silence
摘要
大语言模型(LLM)智能体日益在演进的软件仓库上运行,其成功依赖于仓库特定的程序性知识:该调用哪些API、该运行哪些脚本、以及当前发布版本期望哪些约定。智能体技能将这些知识外化为可复用单元,先前工作表明它们能提升智能体性能。尚不清楚的是这种提升是否持久。使技能有用的同一种版本特异性也使它脆弱:一次发布之后,技能可能在没有任何显式信号的情况下过时,同时继续提供过时的指导。因此,把知识外化为技能可能使其衰减变得不可见。我们研究智能体能否让这种外化知识保持最新。Repo2Skill-Evo将每次发布转换定义为一项技能维护任务:给定V1技能集和官方的V1到V2补丁,智能体必须更新过时的技能内容,同时保留仍然有效的指导。在57个真实仓库和105个精选发布转换上,每一个受评估的转换都使V1技能集部分失效。然而,六个前沿智能体在以补丁为根据的移除指标下(该指标平衡过时内容召回与过度编辑精度)仅达到29.9%-69.7%的avg@3宏F1。跨运行来看,两种相反的错误占主导:技能集中对受影响文件覆盖不全使过时内容原封未动,而过宽的编辑伴随更高召回但更低精度。仓库技能在无声中过时,即使前沿智能体也无法可靠地维护它们。
