论文

VisTIRA:经结构化工具集成弥合视觉数学推理中的图文模态差距

VisTIRA: Closing the Image-Text Modality Gap in Visual Math Reasoning via Structured Tool Integration

模型训练监督微调与指令调优

摘要

当相同问题以图像而非文本呈现时,视觉语言模型(VLM)的数学推理落后于纯文本语言模型。我们实证刻画了这一模态差距:文本形式的同一问题准确率显著高于其视觉排版版本,原因在于阅读密集公式、版面与符号-图形混合上下文时的复合失败。首先,我们提出 VisTIRA(Vision and Tool-Integrated Reasoning Agent),一个工具集成推理框架,通过把给定(图像形式的)数学问题迭代分解为自然语言推理与可执行 Python 步骤来确定最终答案,实现结构化问题求解。其次,我们构建一个测量并改进视觉数学推理的框架:一个把思维链数学语料(如 NuminaMath)转换为富有挑战性的图像版本的基于 LaTeX 的管线,以及源自真实作业式图像数据集(称为 SnapAsk)的大量合成工具使用轨迹,用于微调 VLM。我们的实验表明,工具集成监督改进基于图像的推理,OCR 锚定可进一步为更小模型缩小差距,尽管其收益随规模增大而递减。这些发现凸显模态差距严重程度与模型规模呈负相关,且结构化推理与基于 OCR 的锚定是推进视觉数学推理的互补策略。