论文
MathVis-Fine:经渐进依赖引导训练使视觉监督与必要性对齐的多模态数学推理
MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning
摘要
思维链(CoT)推理已从纯语言域扩展到多模态场景——但既有方法常把视觉输入当作同质或辅助信号——未能捕捉数学解题中文本与图像间错综、样本专属的依赖。这产生两个核心问题:第一——视觉内容的监督信号泛化且粗粒度——缺乏对每个样本中视觉信息实际必要性的适配;第二——当视觉奖励被不加区分地统一施加、不辨输入间互补关系时——训练反馈失准。这些局限阻碍模型实现精确多模态推理。本工作中——我们提出建模数学推理中细粒度视觉依赖的框架。我们首先构建MathVis-Fine数据集——以视觉依赖评级增广细粒度视觉标注。基于该数据集——我们引入两阶段渐进视觉增强训练范式——按每样本的内在视觉依赖水平平衡答案正确性奖励与视觉定位奖励——从而缓解奖励偏置、提升监督精度。大量实验证明MathVis-Fine框架有效依视觉依赖渐进增强视觉感知——为多模态数学推理提供更精确的训练框架。接收后我们将发布数据集。
