论文
SVSR:一种面向多模态推理的自验证与自矫正范式
SVSR: A Self-Verification and Self-Rectification Paradigm for Multimodal Reasoning
摘要
当前多模态模型常受浅层推理之苦,导致思维过程不完整或不一致而引发错误。为解决这一局限,我们提出自验证与自矫正(Self-Verification and Self-Rectification, SVSR),一个将自验证与自矫正显式集成到模型推理流程中的统一框架,显著提升复杂视觉理解与多模态推理任务的鲁棒性与可靠性。SVSR建立在一个新颖的三阶段训练范式之上。首先,我们通过精炼预训练视觉-语言模型的推理轨迹构建高质量统一偏好数据集,融入前向与后向推理以嵌入自反思信号。其次,我们在该数据集上进行冷启动监督微调,以学习结构化的多步推理行为。第三,我们应用半在线直接偏好优化(Semi-online DPO)流程,用经强大教师VLM过滤的高质量模型自生成推理轨迹持续扩充训练语料。这一流程使模型能够学习、激发并精炼其自验证与自矫正能力。跨多个基准的大量实验表明,SVSR提升了推理准确率,并对未见过的任务与题型实现更强的泛化。值得注意的是,经显式自反思推理训练后,模型还展现出更强的隐式推理能力,即使不提供显式推理轨迹也能超越强基线。这些结果凸显了SVSR在构建更可靠、自省且认知对齐的多模态系统方面的潜力。
