论文
循环语言模型的思维链可监控性
On the Chain-of-Thought Monitorability of Looped Language Models
摘要
思维链(CoT)监控为检测不良模型行为提供了有前途的方法。循环语言模型(LoopLM)重复应用共享transformer层,在不增大模型体积的情况下增加有效计算深度并支持额外潜计算。但循环架构对CoT可监控性的影响基本未被探索。本文首次系统评估LoopLM的CoT可监控性,研究两个互补设置:(1)在同一LoopLM族内变化循环深度以隔离额外递归计算的影响;(2)把LoopLM与按参数量、层数或有效深度匹配的非循环模型比较,研究LoopLM是否更难监控。在MonitorBench的八个任务及标准与压力测试设置下,我们观察到特定逻辑/科学/工程"线索回答"任务在压力测试下CoT可监控性出现任务依赖的下降,其他任务呈现更弱或定性不同的趋势。诊断表明这些下降不能完全由任务难度、验证通过率或生成token长度解释;定性例子进一步提示更深循环模型显式使用或归因所提供线索的方式发生变化。跨模型比较未发现LoopLM系统性地比按规模或深度匹配的非循环模型更难监控的证据。总体而言:更深的循环深度在压力测试下会降低部分任务的可监控性,但循环transformer架构本身并不必然意味着更低的可监控性。