论文

过度思考:放大推理权重以提取学得的秘密

Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets

模型评测安全与风险评测

摘要

语言模型的黑盒审计是必要的部署前工具,但可能错过微妙的未对齐与隐藏信息。为在审计过程中更好地引出隐藏信息,我们引入过度思考(overthinking):使用推理任务向量放大推理模型“出声思考”倾向的过程。给定非推理指令模型M与推理蒸馏模型R的参数,我们把过度思考模型定义为θ_Oα = θ_M + α(θ_R − θ_M)——α>1放大超出纯推理模型R的推理。另引入新的逐层衰减策略:选择性放大推理而不损失模型输出的质量与连贯性。我们演示过度思考模型在四个实验设定、2B–32B模型上更可能揭示隐藏信息。发现提示:推理放大可surface训练中获得的秘密或非预期行为的频率最高达原推理模型的10倍。秘密如何surface取决于秘密类型:有些需要沿推理方向扰动,有些则对任何足够大的权重扰动屈服。

过度思考:放大推理权重以提取学得的秘密:论文配图
(a) 全局范数随机:所有参数按单个因子缩放以匹配总 L2 范数。(b) 层范数随机:每个参数张量单独缩放以匹配每个组件的 L2 范数。图 7:跨模型大小(2B、4B、8B)的随机基线扰动,比较全局与逐层范数匹配策略。