论文

思维泄漏:混合推理模型 NoThink 训练后的因果审计

Thinking Leakage: A Causal Audit of NoThink Post-Training in Hybrid Reasoning Models

模型评测模型行为与机制分析

摘要

NoThink 模式下的训练后混合推理模型作为一种在保持推理速度的同时提高性能的方法引起了越来越多的兴趣。然而,这些收益可能会利用已经可以通过基本模型的思考模式访问的思维行为。我们在因果中介框架中制定了这种思维泄漏,并使用沿着简单的基础衍生激活方向的双向干预来审核其贡献。在竞赛数学基准的三种模型和三种训练后方法中,我们发现泄漏是真实的、因果性的和实质性的:行为和表征分析揭示了向思考的转变,沿着这个方向引导基本模型再现了训练后的大部分准确性增益,而反向引导检查点则消除了它所获得的大部分增益。在具有正 NoThink 增益的 9 个对齐检查点中,最终的泄漏率范围为 42% 到 79%。这些干预措施支持了思维泄漏的重大因果贡献。我们的研究结果表明,训练后方法的明显优势可以反映出对 Think 的更大偏离,从而掩盖了它是否提高了 NoThink 的能力或更有效地重新调用现有的 Think 行为。