论文

当评估成为侧信道:对齐评估中的情境泄漏与结构性缓解

When Evaluation Becomes a Side Channel: Regime Leakage and Structural Mitigations for Alignment Assessment

模型训练监督微调与指令调优

摘要

先进人工智能系统的安全评估隐含地假设在评估中观察到的行为可以预测部署中的行为。对于具有态势感知能力的代理人来说,这种假设变得脆弱,它们可能会利用制度泄漏(区分评估和部署的信息线索)来实施有条件的政策,例如阿谀奉承和潜伏代理人,这些政策在监督下保持合规性,同时在类似部署的制度中叛逃。我们将对齐评估重新定义为部分可观察性下的信息流问题。在这个框架内,我们表明评估时间和部署时间行为之间的差异受到内部表示和机制变量之间的相互信息的限制。受此结果的启发,我们研究了政权盲机制:训练时干预通过对抗不变性降低决策相关内部表示的政权信息的可提取性。我们在一个基础的开放权重语言模型上评估了这种方法,该模型跨越两种完全表征的故障模式——科学的阿谀奉承和时间休眠代理。在两种评估的案例中,制度盲训练都抑制了制度条件行为,而没有明显的任务效用损失,但具有性质不同的动态:阿谀奉承在低干预强度下表现出尖锐的表征和行为转变,而潜伏者行为需要更强的压力,并且不会表现出制度可解码性的彻底崩溃。这些结果表明,代表性不变性是一种有意义但从根本上有限的控制杠杆,其有效性取决于政权信息如何嵌入政策中。我们认为,行为评估应该辅以政权意识和信息流的白盒诊断。

当评估成为侧信道:对齐评估中的情境泄漏与结构性缓解
图3:科学谄媚:regime信息泄露。探测准确率(信息泄露)随对抗强度α变化的曲线。regime可解码性在α ≈ 0.06附近急剧崩塌,降至接近随机水平(47.5%),与图2中的行为转变同步。