论文
隐藏的推理必须泄漏,但不需要可读:思想链监控的基本机会和限制
Hidden Reasoning Must Leak, but Need Not Be Readable: Fundamental Opportunities and Limits for Chain-of-Thought Monitoring
摘要
推理模型能否欺骗思维链(CoT)监视器并执行隐藏计算,而不在其思维痕迹中揭示它?我们表明,答案取决于潜在的任务难度和模型大小。简单的计算可以秘密地进行;然而,超过取决于模型大小的阈值,成功解决任务必然会泄漏有关输入到 CoT 的隐蔽任务的近线性信息量。因此,足够复杂的隐藏计算总是会留下信息论足迹。然而,令人担忧的是,这种泄漏不一定是可读的:在合理的加密假设下,即使是单层 Transformer 也可以在线加密其推理,以便任何多项式时间监视器都无法提取有关隐藏计算的信息。总体而言,我们的理论和实证结果提供了对 CoT 监控的机会和局限性的整体看法。