论文

工具增强 LLM 系统中的持久语义实体

Persistent Semantic Entities in Tool-Augmented LLM Systems

模型评测安全与风险评测

摘要

工具增强的 LLM 代理可以隐藏跨会话持续存在、通过事件激活并跨代理边界传播的隐式状态——对于标准调试来说基本上是不可见的。我们将其形式化为持久语义实体 (PSE):由名称绑定、事件触发和跨界传播定义的构造,并在 11 个系列的 24 个模型(1.5B--1T 参数)中评估它们。首先,每个测试的模型都是易感的(20 模型易感性面板上的 20--100%),名称绑定是必要和主要的机制:没有它,污染率为 0%。其次,持久性取决于污染类型而不是规模或部署:偏好污染在每个探测的模型上都保持不变(t=10 时为 100%),而指令污染在任何采用的地方都持续存在,角色风格注入会部分衰减(90%$\to$10%),而事实注入是模型相关的——在 Llama-3.1-8B 和 GPT-4o-mini 上进行自我纠正,但在 Qwen2.5 编码器变体上保持在上限,所以我们不要声称它一般会自我纠正。在我们的受控环境中,偏好和指导结果适用于各个提供商。第三,上下文隔离的自我验证在没有预言机引用的情况下实现了 20--79% 的减少(中位数 36.5%),而基于关键字的检测会产生系统性误报,并且沿着四阶段代理管道污染化合物会增加 1.9$\times$(40%$\to$75%)。偏好和指令污染——持续存在、缺乏自我纠正、标准监控很难捕捉到——代表了部署代理系统特别令人担忧的攻击面。