论文

并非所有 LLM 推理都在思想链中可见

Not All LLM Reasoning is Visible in the Chain-of-Thought

模型评测模型行为与机制分析

摘要

人工智能安全的一个关键问题是语言模型是否在其输出标记中表达了其所有推理。我们演示了一种具体的故障模式,其中前沿模型通过利用语义上不相关的填充标记来展示隐形推理,以提高综合推理任务的性能。我们跨三个任务评估了 13 个前沿语言模型,发现许多模型从填充标记中受益匪浅,准确率提高了高达 13 个百分点。好处取决于使用的词元,并且不同型号的词元有所不同。我们进一步表明,填充词元使 Claude Opus 4.5 能够满足隐藏的模块化算术约束,而不会牺牲其主要任务的准确性,这表明隐形推理可以服务于 CoT 监控完全不可见的目标。强化学习使 Qwen3-235B 对填充词元内容具有强烈的偏好,但 RL 和监督 微调 都不会产生在测试时持续存在的填充词元优势。我们的结果表明,前沿模型已经执行了结果计算,其输出标记中没有可解释的痕迹。