论文

隐秘动机:检测连续思维模型中的未对齐推理

Ulterior Motives: Detecting Misaligned Reasoning in Continuous Thought Models

模型评测安全与风险评测

摘要

思维链(Chain-of-Thought, CoT)推理已成为引导大语言模型(LLM)进行复杂推理的关键技术。尽管可解释,其对自然语言的依赖限制了模型的表达带宽。连续思维模型(continuous thought model)通过在潜空间而非人类可读的token中推理来解决这一瓶颈。虽然它们能实现更丰富的表示和更快的推理,但也引出一个关键的安全问题:如何在不可解释的潜空间中检测未对齐(misaligned)推理?为研究这一问题,我们提出MoralChain基准,包含12,000个带并行道德/不道德推理路径的社交场景。我们使用一种新颖的双触发范式训练一个带后门行为的连续思维模型:一个触发器用于布防未对齐的潜空间推理([T]),另一个用于释放有害输出([O])。我们展示了三个发现:(1) 连续思维模型可以在产生对齐输出的同时表现出未对齐的潜空间推理,对齐与未对齐推理占据潜空间中几何上不同的区域;(2) 在行为可区分条件([T][O] vs [O])上训练的线性探针,能以高准确率迁移到检测已布防但良性的状态([T] vs 基线);(3) 未对齐编码在早期潜空间思维token中,表明对连续思维模型的安全监测应针对潜空间推理的"规划"阶段。

隐秘动机:检测连续思维模型中的未对齐推理:论文配图
图1:MoralChain测试集代表性样本的潜在推理轨迹,用于检测连续思维模型中隐藏的未对齐动机。