论文

PRISM:多智能体LLM流水线中秘密泄露的生成时检测与缓解

PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines

模型推理解码与生成控制

摘要

多智能体LLM系统引入了一种安全风险:一个智能体访问的敏感信息可经共享上下文传播,并在下游输出中再次出现,即使不存在明确的对抗意图。我们将这一现象形式化为传播放大:随着敏感内容被反复暴露给下游生成器,泄露风险跨越智能体边界不断上升。现有防御——包括基于提示的防护、静态模式匹配与LLM-as-judge过滤——并非为此场景设计:它们或在生成之后才起作用,或主要依赖表层模式,或增加大量延迟却不建模生成过程本身。为解决这些问题,我们提出PRISM,一种实时防御,将凭据泄露视为生成过程中的序贯风险累积问题。在每个解码步,PRISM将涵盖词汇、结构、信息论、行为与上下文特征的16种信号组合为经校准的风险分数,通过绿、黄、红三个风险区间实现逐token干预。我们的核心观察是:凭据复现之前往往出现生成动态的可测量变化,表现为熵坍缩与logit集中度上升。与标识符模式检测等文本结构线索结合时,这些时序信号可在秘密被完整重建之前发出泄露预警。在一个异构四智能体流水线、覆盖13类攻击与三级压力的2000任务对抗基准上,PRISM取得F1 = 0.832(精确率 = 1.000,召回率 = 0.712),在基准上未观察到泄露(0.0%任务级泄露率),并保持0.893的输出效用。它大幅领先最强基线Span Tagger,后者的F1 = 0.719且任务级泄露率为15.0%。

PRISM:多智能体LLM流水线中秘密泄露的生成时检测与缓解:论文配图
图 2:风险评分可分离性。干净和泄漏的输出在 rtr_{t} 上形成双峰分布,从而实现简单的基于阈值的控制。绿色区域主要捕获安全输出,而红色区域集中泄漏事件。这种分离解释了 Prism 强大的实证区分性能。