论文
代理规则是塑造还是扭曲?护栏打败了编码代理的指导
Do Agent Rules Shape or Distort? Guardrails Beat Guidance in Coding Agents
摘要
开发人员越来越多地通过自然语言指令文件(例如 CLAUDE.md、.cursorrules)指导 AI 编码代理,但没有对照研究衡量这些规则是否真正提高了代理性能,或者哪些属性使规则有益。我们从 GitHub 上抓取了 679 个此类文件(25,532 条规则),并进行了第一次大规模实证评估,在 SWE-bench Verified 上使用最先进的编码代理运行了 5,000 多次代理。规则可以将绩效提高 7--14 个百分点,但随机规则与专家策划的规则一样有帮助——这表明规则是通过上下文启动而不是特定指令来发挥作用的。消极约束(“不要重构不相关的代码”)是唯一对个人有利的规则类型,而积极指令(“遵循代码风格”)则积极有害——我们通过基于潜力的奖励塑造(PBRS)的视角来分析这种模式。此外,单独的规则大多是有害的,但总的来说是有帮助的,最多 50 条规则不会降低性能。这些发现暴露了隐藏的可靠性风险——善意的规则通常会降低代理的性能——并为安全代理配置提供了明确的原则:限制代理不能做什么,而不是规定他们应该做什么。