论文
沉默中的错误思考:对连续潜在推理的后门攻击
Thinking Wrong in Silence: Backdoor Attacks on Continuous Latent Reasoning
摘要
新一代语言模型完全在连续隐藏状态下进行推理,不产生标记,也不留下审计跟踪。我们证明,这种沉默创造了一个全新的攻击面。 ThoughtSteer 扰乱输入层的单个嵌入向量;该模型自己的多通道推理将这种扰动放大为被劫持的潜在轨迹,该轨迹可靠地产生攻击者选择的答案,同时在结构上对每个 词元级 防御保持不可见。跨越两种架构(Coconut 和 SimCoT)、三种推理基准以及从 124M 到 3B 参数的模型规模,ThoughtSteer 实现了 >=99% 的攻击成功率,具有接近基线的干净准确度,无需重新训练即可转移到保留基准(94-100%),规避所有五种评估的主动防御,并在干净的 微调 的 25 个时期中幸存。我们将这些结果追溯到一个统一的机制:潜在空间中的神经崩溃将触发的表示拉到紧密的几何吸引子上,解释了为什么防御失败以及为什么任何有效的后门必须留下线性可分离的签名(探针 AUC> = 0.999)。然而,出现了一个惊人的悖论:即使模型输出了错误的答案,单个潜在向量仍然编码正确的答案。对抗性信息不是在任何单个向量中,而是在集体轨迹中,将后门扰动建立为连续推理的机械解释性的新镜头。代码和检查点可用。