论文
</think> 不停止推理:虚假 CoT 终止分析
</think> Doesn't Stop Reasoning: Analysis of Spurious CoT Termination
摘要
思想链 (CoT) 推理改进了复杂任务上的大型推理模型 (LRM),但通常会产生长且冗余的痕迹。最近的 无需训练 提前退出方法通过选择中间点来停止推理来缩短这些痕迹。我们研究了一种这样的策略,该策略在此时注入思考结束标记(EoT,</think>)以触发推理到回答的转换,并发现注入的 EoT 并不总是引发干净的回答阶段。应答阶段生成可以在模型重新生成另一个 EoT 之前继续,在此重新生成的 EoT 之前的跨度可以通过提前退出保存的推理词元进行缩放并表现出持续的推理行为。我们称之为虚假 CoT 终止,其中类似推理的生成继续进入回答阶段。我们假设对注入的 EoT 关注不足会导致虚假 CoT 终止,并使用退出词元注意偏差 (EAB) 来探讨这一假设。在四个 LRM、五个基准测试和两个提前退出方法中,增加对注入 EoT 的关注可减少虚假 CoT 终止和应答阶段长度。这些结果揭示了通过外部匹配其显式思维块格式来控制 LRM 的局限性。插入 EoT 词元符合此格式,但其本身并不能保证预期的推理到答案的转换。我们的代码可在 https://github.com/Seunghee-Koh/Spurious-CoT-Termination 获取。