论文

诊断答案正确的长CoT训练轨迹中的有害延续

Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces

模型训练监督微调与指令调优

摘要

长思维链(chain-of-thought,CoT)轨迹被广泛用作面向推理的LLM SFT监督数据,但答案正确的轨迹仍可能导致明显不同的微调结果。我们研究答案正确的长CoT数据中的结论后延续(post-conclusion continuation):即答案看起来已得到充分支持,但轨迹仍以额外推理继续,且这些内容留在监督目标之中。为检验其训练影响,我们使用一个仅删除的编辑器构建保留答案的后缀删除,并比较在原始轨迹与处理后轨迹上进行的基于CoT的SFT。我们观察到,移除编辑器识别出的结论后延续后SFT结果有所改善,表明这种延续在我们的设定下对训练有害。因此我们将这一有实证支持的现象称为有害延续(harmful continuation)。除这一干预外,我们进一步通过不确定性与隐藏状态进展来刻画被移除的结论后延续。我们观察到持续的局部不确定性与终末方向进展的削弱同时出现,形成不确定性-几何失配。最后,我们实现有害延续截断(Harmful Continuation Cut,HCC),一个近似编辑器所识别的结论后延续边界的轻量级边界代理。

诊断答案正确的长CoT训练轨迹中的有害延续:论文配图
图3:保留推理与被编辑移除续写的隐状态进展:(a)词元归一化隐位移的ECDF,(b)隐位移与前向进展的关系。