论文

LLM 管理的多代理系统中的迭代审计收敛:即时工程质量保证的案例研究

Iterative Audit Convergence in LLM-Managed Multi-Agent Systems: A Case Study in Prompt-Engineering Quality Assurance

智能体系统Agent Harness

摘要

多代理 大语言模型 (LLM) 系统的提示规范在相互依赖的文件之间携带数据契约和集成逻辑,但很少受到严格的结构化检查。我们报告了应用于 AEGIS(自主工程治理和智能系统)的迭代、代理驱动审核的单系统案例研究,这是一个七通道生产管道,其 7152 行规范表面经过九轮审核,发现了 51 个一致性缺陷(每轮计数为 15、8、12、2、8、1、4、1、0)。我们提出了一个七类事后分类法,具有明确的编码规则、与级联编辑和审计范围扩展一致的非单调收敛以及锁定的审计协议。我们进一步报告了公共合成迷你规范的两个部分重复:由四个前沿供应商(OpenAI、Anthropic、Google、xAI;12 条痕迹;多供应商联合检测所有五个种子缺陷)组成的跨 LLM 小组,以及对分层子样本的评估者间可靠性检查(Cohen 的 $κ$ = 类别上的 0.80,严重性上的 0.46)。提交时附有完整的可重复性包。