论文

谁在维护Agent Skills?人工主导、AI辅助的长期观察

Who Maintains Agent Skills? A Longitudinal Study of Human-Governed, AI-Assisted Skill Maintenance

模型评测智能体系统Agent Skills基准与评测资源

摘要

终身 LLM 代理越来越依赖外部技能工件作为随着时间的推移保留和重用能力的要素之一。这些技能(通常是可移植的 Markdown 文件,例如 SKILL.md)描述了何时以及如何应用功能,并且随着工具和使用模式在部署过程中的变化,必须进行纠正、扩展和整合。最近的工作寻求自动化技能管理,但它主要根据自动化基线进行评估,并将人工维护视为无法衡量的瓶颈。我们直接研究那个缺失的过程。我们挖掘了五个公共人工智能技能存储库的完整提交历史,这是人工智能工具组织的有目的样本,涵盖 2025 年 10 月至 2026 年 6 月的 873 个提交、143 个技能文件和 254 个实质性的创建后编辑。我们使用预先注册的治理、操作和触发证据密码本对每个编辑进行编码。出现了三个发现。首先,每个实质性编辑都是通过指定的人类帐户创作或合并的,而 62% 的编辑带有 AI 共同作者预告片,存储库级别存在较大差异。其次,这些编辑是真正的策划:经过审计的样本显示,大多数更改了技能内容,并且编码操作以添加和更正为主。第三,预先注册的规则相似轴未通过其可靠性门;从提交工件中可靠地编码规则相似性仍然是一个开放的测量问题。我们发布了语料库、密码本、挖掘脚本和用于自动化技能管理器的重播协议。对于自我进化的代理来说,公共技能维护目前看起来不太像一个自治管道,而是一个由人类管理、人工智能辅助的循环,未来的策展人必须在其中进行衡量和操作。