传染张量:用于测量多代理 LLM 系统中的输出分布耦合的框架 - 并审计它所支持的声明
The Contagion Tensor: A Framework for Measuring Output-Distribution Coupling in Multi-Agent LLM Systems -- and Auditing the Claims It Enables
摘要
我们引入了传染张量,这是一种测量框架,用于量化 大语言模型 (LLM) 输出分布如何跨模式、代理和时间步耦合。从张量中,我们得出耦合放大因子 (CAF),这是一系列基于比率的度量,共享形式 CAF = E[T_condition] / E[T_baseline],提供无单位、基线参考测量和自举置信区间。我们实例化了四种变体的 CAF,并通过特定模态消融的完整 2x2x2 块正交仿真设计来评估最强的变体。消融表明,当禁用图像扰动模块时,明显的图像条件超线性效应 (CAF = 1.40) 会崩溃为亚线性效应 (CAF = 0.87),偏移为 -0.53,对文本条件的影响为零。我们补充了两个模型系列的真实 API 实验:DeepSeek-Chat (R=30) 和 GPT-4o-mini (R=15,真实视觉)。在统一角色下,纯文本通信在两种模型中产生的 CAF 约为 1.0。多样化的角色推动融合(CAF = 0.88)。 GPT-4o-mini 上的模型内比较显示:C3(文本)CAF = 1.02 与 C5(真实视觉,R=30)CAF = 1.72 [1.700, 1.733],delta = +0.70,验证了模拟的超线性图像条件预测。在 11 种条件中,5 种已在真实 API 上进行了测试,6 种尚未验证。我们的贡献有两层:(1)一种测量工具,使输出-分布耦合在数量上可证伪; (2)任何模块化多智能体模拟器都可以采用的可转移消融协议来区分真正的耦合与设计工件。