论文
只有事实,没有规则:多智能体大语言模型交接中的边界元数据丢失
Facts Without Rules: Boundary Metadata Collapse in Multi-Agent LLM Handoffs
摘要
多代理 LLM 系统通常通过将上游交互压缩为下游代理将其视为共享状态的切换工件来进行协调。我们表明,这种切换步骤是隐私泄漏的结构性根源:摘要优先保留操作事实,同时削弱控制这些事实如何使用的边界元数据——我们称之为\emph{摘要崩溃}的故障模式。在受控的多智能体协调测试平台上,我们通过人工验证的判断来测量标记的存活率 ($κ= 0.74$),其中 $σ_b = 1$ 意味着每个边界标记都逐字存活,而 $σ_b = 0$ 意味着所有边界标记都丢失了。边界标记和操作事实生存在 GPT-5-mini 和 DeepSeek-R1-32B 上的切换级别上几乎不相关(Pearson $r$ 接近于零):未压缩的自由文本切换将边界保留在 $σ_b \approx 0.80$,而 $25$ 字预算将 $σ_b$ 下降到 ${\approx}0.57$,而操作事实生存保持在附近天花板。受控的下游测试表明,保护取决于 \emph{边界显性}:模糊语言在 GPT 的 $73\%$ 和 DeepSeek 的 $50\%$ 案例中泄漏,而显式约束将所有三个测试模型的泄漏减少到 $15\%$ 以下。无切换单代理控制进一步表明故障不能简化为多代理拓扑,因为直接全标记访问仍然比操作化切换更频繁地泄漏。仅提示缓解和精确字符串编辑只能部分解决问题,而标准衍生的受众许可名单几乎消除了模型之间的泄漏,这表明正确识别受众边界是关键因素。