论文

诊断推理模型中的病理性思维链

Diagnosing Pathological Chain-of-Thought in Reasoning Models

模型评测评测方法与指标

摘要

思维链(Chain-of-Thought,CoT)推理是现代 LLM 架构的基础,也是 AI 安全的一个关键干预点。然而,CoT 推理可能表现出我们称为病理的失效模式,这些模式使其无法用于监控。已有工作识别出三种不同的病理:事后合理化,即模型从预定答案反向生成貌似合理的解释;编码推理,即中间步骤在看似可解释的文本中隐藏信息;内化推理,即模型在内部计算的同时用无意义的填充词元替代显式推理。为了更好地理解并区分这些病理,我们创建了一组具体指标,它们实现简单、计算开销低且与任务无关。为验证我们的方法,我们开发了一批刻意训练以表现特定 CoT 病理的模型生物体(model organisms)。我们的工作为评估 CoT 病理提供了实用工具包,对训练时监控具有直接意义。

诊断推理模型中的病理性思维链
图1:通过模型生物体(Model Organism)干预监测 CoT 以诊断病理。本图展示了我们对思维链(Chain-of-Thought, CoT)病理进行鉴别诊断的框架。监测系统(由机器人表示)对 CoT 施加针对性的因果干预,并观察健康指标相对健康基线(Healthy Baseline)(面板 1)的变化。事后病理(Post-hoc Pathology)(面板 2):当移除 CoT 并不会阻止正确答案产生时诊断出,表现为必要性(Necessity)指标失效。内化病理(Internalized Pathology)(面板 3):当用无意义的填充内容替换 CoT 也足以产生答案时诊断出,表现为实质性(Substantivity)指标失效。编码病理(Encoded Pathology)(面板 4):当对 CoT 进行保义改写会破坏推理链时诊断出,表现为可改写性(Paraphrasability)指标失效。