论文
大语言模型仅凭先前反馈学会规避潜空间监控
LLMs Learn to Evade Latent Monitors from Prior Feedback Alone
摘要
潜空间监控器旨在通过检查Agent的内部激活而不是其输出来检测 LLM Agent中的不良行为。然而,交互式监控创建了一个反馈通道,监控器的每个判决都会向模型提供有关如何评估其内部状态的信息。我们询问Agent是否可以从该反馈中推断出监视器的决策规则,然后有选择地编辑其激活以逃避检测。与之前的规避攻击不同,研究者从未明确告诉模型监控器检测什么。令人惊讶的是,现成的模型已经产生了与监控方向一致的激活编辑,但不足以规避。只需将这些编辑放大 8 倍即可将监控器的 TPR 从 100% 降低到 27%。 秩1 LoRA 将这种行为放大为前向传播中的有效规避,将留出概念监控器上的 TPR 进一步降低至 4%,同时使其他概念保持正常检测率。在这种微调下,标准基准的能力得以保留,并且规避技能在新激活的监视器上重新训练后仍然存在。从机制上讲,我们发现证据表明该模型根据先前的上下文回合计算其激活编辑,并表明随着提供更多示例,编辑变得与监控方向更加一致。这些结果证明了对激活的反馈条件控制,并表明潜在监控应被视为一个交互式过程,在该过程中主体可以观察并响应监督措施。