论文
平衡思考:改进视觉语言模型的思维链训练
Balanced Thinking: Improving Chain of Thought Training in Vision Language Models
摘要
视觉语言模型(VLM)的多模态推理通常依赖两阶段过程:监督微调(SFT)与强化学习(RL)。在标准 SFT 中,所有 token 对损失的贡献均等,尽管推理数据天然存在 token 不均衡。冗长的 <think> 轨迹掩盖了简短但任务关键的 <answer> 片段,导致推理冗长与答案不准确。我们提出 SCALe(Scheduled Curriculum Adaptive Loss),通过动态且与长度无关的加权显式分离对推理与答案片段的监督。与过度加权 <think> 片段的普通 SFT 不同,SCALe-SFT 通过余弦调度策略在训练全程将焦点从 <think> 逐步转向 <answer>,鼓励简洁且有依据的推理。我们在多样的基准与架构上评估 SCALe。结果表明,SCALe 相对普通 SFT 持续提升准确率,并以约七分之一的训练时间匹敌完整两阶段 SFT+GRPO 流水线的性能,是一个轻量而有效的替代方案。与 GRPO 结合时,SCALe 取得最佳整体性能,凸显其既可作为独立方法,也是强化精修的坚实基础。
