论文

推理型LLM对其思维链干预是否鲁棒?

Are Reasoning LLMs Robust to Interventions on Their Chain-of-Thought?

模型评测鲁棒性、公平性与可信度评测

摘要

推理型大语言模型(RLLM)在给出答案前生成逐步的思维链(CoT),这提升了复杂任务的表现并使推理更加透明。但这些推理痕迹对其中发生的扰动有多鲁棒?为回答这一问题,我们提出一个受控评估框架,在固定时间步对模型自身的CoT施加扰动。我们设计了七种干预(良性、中性与对抗性),并将其应用于多个开放权重的RLLM,覆盖数学、科学与逻辑任务。我们的结果表明,RLLM总体上是鲁棒的,能从多样的扰动中可靠恢复;鲁棒性随模型规模增大而提升,且当干预发生在较早阶段时会下降。然而,鲁棒性并非风格不变:改写会抑制类似怀疑的表达并降低表现,而其他干预则会触发怀疑并支持恢复。恢复也带有代价:中性与对抗性噪声可使CoT长度膨胀超过200%,而改写虽缩短推理痕迹却损害准确率。这些发现为RLLM如何维持推理完整性提供了新证据,将怀疑确认为核心恢复机制,并凸显了未来训练方法应当应对的鲁棒性与效率之间的权衡。