论文

在 CoT 可监控性方面,看不见就等于心不在焉吗?

Does Out-of-Sight Equal Out-of-Mind in CoT Monitorability?

模型评测模型行为与机制分析

摘要

思想链 (CoT) 推理为 大语言模型 (LLM) 的决策提供了一个窗口,可以通过读取推理轨迹来监控目标行为,从而激励 CoT 可监控性的工作。然而,潜在 CoT 方法用少量连续状态替换显式标记,降低了推理成本,但消除了此监视所依赖的可读跟踪。然后,监控需要对模型进行替代访问,例如探测其激活或将潜在状态重新表达回文本,但这些替代方案保留了多少可监控性尚不清楚。我们使用基于提示的干预设置来研究这个问题,这是模型利用有偏差的输入线索的行为的代理,例如,无意中泄露的答案或用户陈述的信念,而不承认它们。以提示依赖为可监控性目标,我们比较了不同推理模式(从显式 CoT 到弱监督和强监督潜在 CoT)在数学推理和问题回答方面的监控器。我们发现,在这种设置中,可监控性更多地取决于任务的属性(例如正确答案是否限制支持推理)和模型内部的访问级别,而不是推理模式。