论文
诊断推理模型中的病理性思维链
Diagnosing Pathological Chain-of-Thought in Reasoning Models
摘要
思维链(Chain-of-Thought,CoT)推理是现代 LLM 架构的基础,也是 AI 安全的一个关键干预点。然而,CoT 推理可能表现出我们称为病理的失效模式,这些模式使其无法用于监控。已有工作识别出三种不同的病理:事后合理化,即模型从预定答案反向生成貌似合理的解释;编码推理,即中间步骤在看似可解释的文本中隐藏信息;内化推理,即模型在内部计算的同时用无意义的填充词元替代显式推理。为了更好地理解并区分这些病理,我们创建了一组具体指标,它们实现简单、计算开销低且与任务无关。为验证我们的方法,我们开发了一批刻意训练以表现特定 CoT 病理的模型生物体(model organisms)。我们的工作为评估 CoT 病理提供了实用工具包,对训练时监控具有直接意义。
