论文
当内置思维有所帮助和有害时:指令跟随中的约束级错误转移
When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following
摘要
大型推理模型 (LRM) 通常可以提高数学和编码性能,但它们对指令遵循的影响尚不清楚。我们使用 Qwen3 模型 (1.7B-32B) 研究 IFEval,使用相同权重的 Thinking ON/OFF 控制;四种混元车型提供定向跨家庭支持。总体通过率变化很小(-0.55 到 -3.52 pp),但 10-20% 的提示会在通过和失败之间切换,这表明思维改变了错误模式——一些提示改善,而另一些提示恶化——而不是一致降低性能。在 Qwen3 派生的事后分组下,约束类型分为规划(全局计数、结构、协调)和精度(精确局部形式),前者在思维下在类级别上有所改善,后者持续恶化;尽管浑源的总体方向相反,但类级规划/精度符号模式对于所有四种浑源模型都具有方向性。思考也会改变最终答案的长度;匹配长度分析大大减少了精度下降,但仍然存在残余损失。使用跨编码器相关性度量分析思维轨迹揭示了三种模式:中性显示出积极的相关性合规性链接(r 约为 0.15);尽管跟踪参与度可测量,但规划显示预测相关性接近于零(r 约为 0.02),这与 CE 测量的跟踪相关性和最终答案合规性之间的执行差距一致;精度显示出较小的负相关性(r 约为 -0.05),失败的实例比通过的实例具有更高的平均相关性。跨四种模型大小 (1.7B-14B) 的激活修补显示,Precision 翻转实例比 Planning 翻转实例更常恢复(平均层恢复为 32-58% vs. 14-40%),最大差距为 14B(约 30 pp)。