论文
重新审视 后训练 的完整推理轨迹
Revisiting Complete Reasoning Traces for Post-Training
摘要
大语言模型常使用预先收集的推理轨迹进行后训练,以提高推理能力。这些轨迹因路径复杂交织而较长,往往包含通向答案的绕行步骤。但模型是否确实受益于在监督微调等后训练中学习完整轨迹,仍缺少研究。初步实验发现,完整轨迹的收益有限,部分轨迹即使经过大幅截断仍然有效。我们通过注意力分析与受控词元移除实验研究推理轨迹的冗余,两种分析均显示中间词元对最终推理质量的贡献很小。这表明,在已知轨迹端点的情况下,避开冗余信息可能让模型利用内部知识推断缺失步骤,形成连贯的替代路径。此外,使用端点训练模型会持续改变推理行为,也有益于基于强化学习或同策略蒸馏的后训练方法,说明有必要重新审视完整推理轨迹的使用方式。代码:https://github.com/naver-ai/revisiting-trace。