面向组合式Agent框架修复的能力层:受控商化与真实仓库压力测试
Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test
摘要
Agent harness组合了检索、路由、状态、溯源与验证,但局部成功的组件可能在共享状态上不一致。我们用有限“能力层”(capability sheaf)建模这一失效:茎(stalk)编码类型化行为签名,限制映射保留共享字段,被接受的运行是有用的全局截面。一个精确的有限约束满足问题(CSP)定义接受条件,而线性化的相对上同调类提供诊断与搜索特征。在20个任务簇上的受控实验引入了隐藏的内部中介者,其原始状态为干扰变量。对其上边缘做商化将每簇候选预算从2,000降至1,000;对齐隐藏状态则消除该差距。精确CSP与商化结果持平,因此该结果证明的是对过期代表元的不变性,而非优于精确推理。随后我们在PatchFuseBench的SWE-bench Multilingual池的一个发现集上测试该方法:来自20个仓库的160个issue、875个真实候选补丁、2,579个源感知编辑原子以及153个新执行的补丁。首个池级构造是常量,因为在coker D中有 [b−Dx]=[b],故无法为配置排序。按候选索引的修复在848/875个候选上非平凡,并在120/160个issue内有变化。它解决118个issue,而匹配的非上同调选择器解决116个,但该差异在跨仓库层面得不到支持(精确符号翻转检验 p=0.75)。留一仓库弃权门控达到127/160,与强锚点持平,比其匹配门控多解决一个issue(p=1.0)。因此发现集门控失败,确认集保持封存。该研究支持受控不变性机制与可识别性校正,但不支持真实世界中的上同调优势。
