论文

从输出监督学到的思维链混淆可泛化到未见任务

Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks

模型评测安全与风险评测

摘要

思维链(CoT)推理通过支持对行动的规划、探索与深思,为LLM带来显著性能提升。CoT也是监控这些智能体行为的强大工具:当其忠实时,它提供对模型决策过程的解释,并对危险行为发出早期预警。然而,施加于CoT的优化压力可能导致模型混淆推理痕迹,丧失这一有益性质。我们表明,混淆可以跨任务泛化:学会混淆涉及奖励作弊的推理(如访问并利用泄露信息)的模型,会把奖励作弊行为及其在CoT中的混淆一并泛化到未见过的奖励作弊场景。最令人担忧的是,我们表明,即便只在CoT关闭之后惩罚模型的最终行动,CoT推理的混淆及其跨任务泛化同样会出现。我们的发现提示,当前惩罚有害生成的做法可能以不可预测的方式,无意中削弱LLM更广泛的可监控性。