论文

利用语言、行为和机制指标检测 大语言模型 中隐藏的思维链

Detecting Hidden Chain-of-Thought in Large Language Models with Linguistic, Behavioral, and Mechanistic Indicators

模型评测评测方法与指标

摘要

大语言模型 经常回答复杂的推理问题而不透露中间步骤,从而提高了他们是潜在推理还是完整模式。我们提出了隐藏 CoT 检测分数 (HCDS),这是一种比较行为和机制信号,用于衡量中性提示行为是否与显性 CoT 或显性 no-CoT 更紧密地一致。这里,隐藏的 CoT 在操作上表示这种中立提示 CoT 式的对齐方式; HCDS 不直接观察或证明未暴露的推理痕迹。在 GSM8K 上,HCDS 对 Qwen3-4B 变体均显着为正(思考 $+1.87$,$p = 1.2 \times 10^{-7}$;指令 $+1.41$,$p = 1.9 \times 10^{-4}$),在不同的推理堆栈中复制并在 $0.08$ 内进行量化($+1.80$ 和$+1.45$),并且在八个长度调整的校准对照细胞中的七个中不呈显着正值。未调整的分数在单步算术和数字事实查找上产生很大的正分数。这些变体对 no-CoT 指令的反应也不同:指令仅根据提示进行操作,而思考则继续推理并需要干预。这些发现表明,推理调整模型中具有更强、更少的即时条件 CoT 行为,与潜在推理一致,但不是潜在推理的证明。因此,HCDS 可以在不依赖模型自我报告痕迹的情况下研究潜在推理。