论文

推理模型难以控制自己的思维链

Reasoning Models Struggle to Control their Chains of Thought

模型评测安全与风险评测

摘要

思维链(CoT)监控是检测不当行为和理解现代推理模型动机的有前景的工具。然而,如果模型能控制它们在CoT中言语化的内容,就可能破坏CoT的可监控性。为测量这种不良能力——CoT可控性——我们引入CoT-Control评估套件,其中包含要求模型在遵循CoT指令的同时解决问题的任务,例如在推理遗传学问题时不用"染色体"一词。我们表明,推理模型的CoT可控性显著低于输出可控性;例如,Claude Sonnet 4.5仅有2.7%的时候能控制其CoT,而控制其最终输出时有61.9%。我们还发现,CoT可控性在更大模型中更高,并随更多RL训练、测试时算力和问题难度增加而下降。CoT可控性失败甚至延伸到模型被给予激励(而非直接要求)以规避CoT监控器的情形,尽管当模型被告知正被监控时表现出略高的可控性。类似地,通过对抗性优化提示来诱发可控性并不能有意义地提高可控性。我们的结果让我们保持谨慎乐观:CoT可控性目前不太可能成为CoT可监控性的失效模式。然而,低可控性背后的机制尚不清楚。鉴于其对维持CoT可监控性的重要性,我们建议前沿实验室在未来的模型中跟踪CoT可控性。