论文

曲线推理 II:潜伏后门智能体几何 - 将可解释性扩展到探针之外

Curved Inference II: Sleeper Agent Geometry - Extending Interpretability Beyond Probes

模型评测模型行为与机制分析

摘要

本文扩展了 Anthropic 的 Sleeper Agents 研究 [1],该研究表明人工后门通过安全训练持续存在,并且可以通过线性探针以 >99% 的准确度检测到 [2]。然而,基于探针的检测依赖于线性可分离性,这可能是后门插入的人为因素,而不是自然发生的欺骗性对齐的特性。通过自然训练出现的复杂欺骗行为不太可能产生如此方便的线性信号。我们引入了一种使用多轮上下文窗口的自然主义方法,该方法可以模拟现实的欺骗性推理,而无需人工触发或监督后门插入。我们不是研究二元触发响应模式,而是研究语义复杂性如何通过渐进的上下文开发而出现。基于我们的曲线推理框架,我们分析了曲率、显着性,并引入了语义表面积 (A'),这是一种新的表征工作度量,可捕获非标准化残余空间中意义构建的大小和方向变化。没有后门、标签或探针,我们将该框架应用于自然的欺骗性提示,并通过 LLM 共识对模型输出进行分类。几何结构可靠地预测语义分类,五种提示策略和两个模型系列的表面积具有统计显着差异。至关重要的是,测量精度可以揭示分类噪声隐藏的几何特征 - 一些策略从不显着 (p = 0.555) 改进到显着 (p = 0.048)。这证实了复杂的推理创建了即使在检测似乎失败时仍然存在的内在几何模式,这表明推理的形状本身编码语义模式,无论模型是否已经学会抑制欺骗的线性指标——当线性方法失败时,这是一种可扩展的、无监督的检测路径。