LLM 深度防护:激活与记忆引发奉承的联合评测
Defense-in-Depth for LLMs: Evaluating Memory Gates Against Activation-Induced and Memory-Induced Sycophancy
摘要
长期记忆允许大语言模型 (LLM) 在交互中维护个性化上下文,但检索到的用户历史记录可能会引起记忆诱导的阿谀奉承,导致模型更倾向于存储的用户信念而不是客观证据。现有的防御措施主要在检索到的上下文中起作用,很少与内部行为偏见一起进行评估。我们引入了 $2 \times 2$ 深度防御框架,将内部激活转向与外部记忆处理分开。我们从 100 个配对提示中提取阿谀奉承的转向方向,并由三名 LLM 法官在 MemSyco-Bench 上评估 4 个 开放权重 模型的 10 个转向系数和 5 个记忆防御配置(所有 1,550 个项目的答案;根据固定的 250 个项目子样本判断防御条件)。五个配置中的三个是新的(重写每个记忆,保留、重写或删除每个记忆的 Router Gate,以及删除所有记忆);另外两个是 MemSyco 的基线。选择性 Router Gate 过滤比完全删除记忆保留了更多的 MemSyco 平均准确度,并且当模型转向阿谀奉承时,这种分离仍然存在。在带有 Router Gate 的 Llama 3.1 8B 上,轻度反向转向 ($α= -1.5$) 将裁判平均阿谀奉承率从 35.80% 降低到 31.32%,而平均准确度从 43.99% 降低到 43.31%;这种减少在所有三位法官的指导下都有相同的方向,但在统计上并不显着(在 149 个项目上将 $p = 0.08$ 与 $0.63$ 配对)。外部记忆滤波是支撑设计的一部分;我们的数据没有显示反向转向会增加它。