论文

规范差距:代码代理部分知识下的协调失败

The Specification Gap: Coordination Failure Under Partial Knowledge in Code Agents

智能体系统Agent任务评测

摘要

当多个基于 LLM 的代码代理独立实现同一类的部分时,它们必须就共享的内部表示达成一致,即使规范隐式地保留了这些选择。我们跨 51 个类生成任务研究了这个协调问题,逐步将规范细节从完整的文档字符串 (L0) 剥离到裸签名 (L3),并将相反的结构偏差(列表与字典)引入压力测试集成。出现了三个发现。首先,持续的规范差距:随着细节被删除,双智能体集成准确度从 58% 下降到 25%,而单智能体基线的降级则更加优雅(89% 到 56%),留下 25--39 pp 的协调差距,这在两个 Claude 模型(Sonnet、Haiku)和三个独立运行中是一致的。其次,基于 AST 的冲突检测器在最弱的规范级别上实现了 97% 的精度,无需额外的 LLM 调用,但阶乘恢复实验表明,仅恢复完整规范即可恢复单代理上限 (89%),而提供冲突报告则没有增加任何可衡量的好处。第三,将差距分解为协调成本(+16 pp)和信息不对称(+11 pp)表明这两种效应是独立的并且近似相加。这种差距不仅仅是隐藏信息的结果,而且反映了在没有共同决策的情况下生成兼容代码的难度。这些结果支持多代理代码生成的规范优先视图:更丰富的规范既是主要的协调机制,也是充分的恢复工具。