论文

平衡思考:改进视觉语言模型的思维链训练

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

模型训练监督微调与指令调优强化学习RLVR

摘要

视觉语言模型(VLM)的多模态推理通常依赖两阶段过程:监督微调(SFT)与强化学习(RL)。在标准 SFT 中,所有 token 对损失的贡献均等,尽管推理数据天然存在 token 不均衡。冗长的 <think> 轨迹掩盖了简短但任务关键的 <answer> 片段,导致推理冗长与答案不准确。我们提出 SCALe(Scheduled Curriculum Adaptive Loss),通过动态且与长度无关的加权显式分离对推理与答案片段的监督。与过度加权 <think> 片段的普通 SFT 不同,SCALe-SFT 通过余弦调度策略在训练全程将焦点从 <think> 逐步转向 <answer>,鼓励简洁且有依据的推理。我们在多样的基准与架构上评估 SCALe。结果表明,SCALe 相对普通 SFT 持续提升准确率,并以约七分之一的训练时间匹敌完整两阶段 SFT+GRPO 流水线的性能,是一个轻量而有效的替代方案。与 GRPO 结合时,SCALe 取得最佳整体性能,凸显其既可作为独立方法,也是强化精修的坚实基础。

平衡思考:改进视觉语言模型的思维链训练:论文配图
图 1:预定课程自适应损失随训练时间的进展与普通 SFT 的比较。在标准 SFT 中,与简短答案段(上图)相比,<think> 部分在输出中占主导地位。 SFT 应用统一的令牌权重,使得损失偏向扩展推理部分(左下图)。 SCALe 解决了这种令牌不平衡的问题,并引入了一个与时间相关的加权计划,该计划逐渐放大答案令牌的影响。随着训练的进展,这会将损失转向最终答案,引导模型优先考虑正确的结果而不是冗长的推理(右下图)。