论文

影响不是无效:询问索赔,而不是差异

Impact Is Not Invalidation: Ask About the Claim, Not the Diff

上下文与知识记忆Agent记忆

摘要

当存储库发生更改时,编码代理的内存系统必须决定哪些存储的声明已变为错误。每当内容锚定来自的工件发生变化时,内容锚定就会使声明无效,这种变化会不断触发。语义等价分类询问差异是否保留行为,这是一个关于差异的问题,而不是关于任何存储的声明的问题。我们展示了第二个信号因与模型功能无关的原因而失败:当询问提交是否保留行为时,跨越 40 倍价格范围的五个模型在 59-72% 的实际提交上触发,并且相对于 0.25 的基本速率,精度仅达到 0.291 到 0.329。相反,当被问及某一具体说法是否仍然成立时,相同差异下的相同模型达到 0.705 至 0.974。将声明文本交给行为保留法官的控件,仅更改问题,将精度移动 0.010 和 0.016;改变问题将其移动 0.49 和 0.65。我们还与 pytest-testmon 进行比较,这是一个部署的回归测试选择器,具有覆盖范围派生的依赖数据:它以 0.415 的精度达到 0.868 的召回率,因此对更改可以达到的近乎完整的了解并不能识别它伪造的内容。基本事实是执行,而不是注释:声明是在提交 t 时通过的测试函数,如果相同的断言文本在 t+1 失败,则声明会翻转。构建这个需要我们在之前的工作中没有发现的观察结果。在 CI 门控主线上,导致先前存在的测试失败的提交无法合并,因此天真的构造在设计上有一个空的正类。我们报告了 10,369 项声明,其中包括从 23 个 Python 库中挖掘的 184 个经过执行验证的翻转、存储库保留的拆分、知识截断后拆分、洗牌差异 null、释义控制以及对 17 个存储库的留一存储库分析。