论文

面向组合式Agent框架修复的能力层:受控商化与真实仓库压力测试

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

智能体系统Agent Harness

摘要

Agent harness组合了检索、路由、状态、溯源与验证,但局部成功的组件可能在共享状态上不一致。我们用有限“能力层”(capability sheaf)建模这一失效:茎(stalk)编码类型化行为签名,限制映射保留共享字段,被接受的运行是有用的全局截面。一个精确的有限约束满足问题(CSP)定义接受条件,而线性化的相对上同调类提供诊断与搜索特征。在20个任务簇上的受控实验引入了隐藏的内部中介者,其原始状态为干扰变量。对其上边缘做商化将每簇候选预算从2,000降至1,000;对齐隐藏状态则消除该差距。精确CSP与商化结果持平,因此该结果证明的是对过期代表元的不变性,而非优于精确推理。随后我们在PatchFuseBench的SWE-bench Multilingual池的一个发现集上测试该方法:来自20个仓库的160个issue、875个真实候选补丁、2,579个源感知编辑原子以及153个新执行的补丁。首个池级构造是常量,因为在coker D中有 [b−Dx]=[b],故无法为配置排序。按候选索引的修复在848/875个候选上非平凡,并在120/160个issue内有变化。它解决118个issue,而匹配的非上同调选择器解决116个,但该差异在跨仓库层面得不到支持(精确符号翻转检验 p=0.75)。留一仓库弃权门控达到127/160,与强锚点持平,比其匹配门控多解决一个issue(p=1.0)。因此发现集门控失败,确认集保持封存。该研究支持受控不变性机制与可识别性校正,但不支持真实世界中的上同调优势。

面向组合式Agent框架修复的能力层:受控商化与真实仓库压力测试:论文配图
图2:一个验证性实验。面板 A 报告等池停止预算。面板 B 分别在每个端点内报告到首次成功为止的总 token 数。面板 C 展示结构判据的留出平衡准确率。面板 D 比较结果盲的生成填充项与预先注册的全局部结构诱饵。