多代理 大语言模型 系统中并发异常的经过验证的检测和预防
Verified Detection and Prevention of Concurrency Anomalies in Multi-Agent Large Language Model Systems
摘要
多代理 LLM 系统通过内存存储、向量索引和工具注册表共享状态。我们将此类共享建模为确定性生成语义下的长期运行的读取-生成-写入操作(通过确定性重播强制执行的机制持久执行引擎),并在 TLA+ 中形式化四种并发异常:陈旧生成、幻影工具、因果级联和工具效果重新排序,它们是经典隔离异常的结构类似物,每个都有一个 TLC 反例。这些异常的排除格是微不足道的;贡献在于机械验证的可实现性和其中一个最大链的严格分离,$L_0 \subsetneq \cdots \subsetneq L_4$,据我们所知,这是此类运行时的第一个机器检查的一致性层次结构。 274 个 Verus 义务(零假设,零承认;信任基础:两个结构公理和一个互斥对应)的开发证明了检测器的健全性和完整性,符合规范和每个运行时的回避集。三个部署的 Rust 运行时实现 L0-L1(悲观锁定、可序列化快照隔离、默认 SI),每个运行时都针对陈旧生成进行验证并细化到其状态机; L2-L4 通过无依赖性预防孪生进行执行模式验证(A3、A6、A2:0/1000 与 1000/1000),并且 L2 在三个模型系列中实时运行(A3 在所有 120 个撤回会话中被阻止)。我们在字节跳动的 deer-flow 中重现了一个静默丢失的更新,将其修复形式化为经过验证的 $L_0 \to L_1$ 细化,并在 LangGraph 的 ToolNode 中对未修改的输出(由 L3 提交顺序排序器删除)进行了工具效果重新排序。经过验证的检测器、改进和可实现性工件是贡献;现象和晶格都是经典的。