论文
诊断答案正确的长CoT训练轨迹中的有害延续
Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces
摘要
长思维链(chain-of-thought,CoT)轨迹被广泛用作面向推理的LLM SFT监督数据,但答案正确的轨迹仍可能导致明显不同的微调结果。我们研究答案正确的长CoT数据中的结论后延续(post-conclusion continuation):即答案看起来已得到充分支持,但轨迹仍以额外推理继续,且这些内容留在监督目标之中。为检验其训练影响,我们使用一个仅删除的编辑器构建保留答案的后缀删除,并比较在原始轨迹与处理后轨迹上进行的基于CoT的SFT。我们观察到,移除编辑器识别出的结论后延续后SFT结果有所改善,表明这种延续在我们的设定下对训练有害。因此我们将这一有实证支持的现象称为有害延续(harmful continuation)。除这一干预外,我们进一步通过不确定性与隐藏状态进展来刻画被移除的结论后延续。我们观察到持续的局部不确定性与终末方向进展的削弱同时出现,形成不确定性-几何失配。最后,我们实现有害延续截断(Harmful Continuation Cut,HCC),一个近似编辑器所识别的结论后延续边界的轻量级边界代理。
