论文

推理跟踪崩溃:评估 微调 期间显式推理的损失

Reasoning-Trace Collapse: Evaluating the Loss of Explicit Reasoning During Fine-Tuning

模型评测评测方法与指标

摘要

显式推理模型经过训练,可以在最终答案之前生成中间推理轨迹,但下游 微调 通常对不包含此类轨迹的普通指令响应数据执行。我们表明,这种不匹配可能会导致推理痕迹崩溃:经过微调的模型继续产生看似合理的最终答案,同时丢失了结构上有效的显式推理痕迹,而正是这些痕迹最初使其成为推理模型。我们引入了一个结构评估框架,将答案正确性与推理轨迹有效性分开,衡量有效、空洞、缺失和截断的推理以及推理条件任务绩效。使用这个框架,我们研究了四种开放权重推理模型,发现标准监督 微调 可以快速抑制有效推理痕迹,而仅答案指标可以在很大程度上掩盖这种失败:在多种设置中,以有效推理为条件的性能仍然很高,而有效推理率却急剧下降。我们进一步表明,简单的损失掩盖策略可以显着减轻崩溃,而不需要教师生成的推理痕迹。这些结果表明,微调推理模型的评估除了最终答案性能之外还应该报告结构推理可靠性指标,特别是当适应数据不包含显式推理轨迹时。