论文
长度惩罚让思维链更难被监视
Length Penalties Make Chain-of-Thought Less Monitorable
摘要
为遏制过度思考并降低推理成本,研究者现在以思维链长度惩罚训练推理模型。我们发现这些惩罚损害可监视性:更短的思维链更少提及误导性提示,但提示仍影响模型答案。我们训练Qwen3 4B与Qwen3 14B产生不同目标思维链长度,再用带偏提示干预在留出MMLU Pro R数据与四个迁移基准上评估。压缩减少推理token并保持多数选择题准确率,而提示影响仍接近基线。在最短目标长度下,下界忠实度降至基线的63.1%(Qwen3 14B)与69.4%(Qwen3 4B);监视器的原始提示检出率分别从69%降到49%、从60%降到48%。为把长度与内容分开,我们从未压缩基线链中随机删句直至与压缩后等长:跨两个模型规模与全部五个评估分布,压缩链对提示的提及仍比这些长度匹配基线少7–35个百分点。我们因此识别出一条压缩—可监视性前沿:降低推理成本所移除的证据,比单纯更短的轨迹所预示的更多。