论文

VAMPS:视觉辅助数学问题解决基准

VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark

模型评测基准与评测资源

摘要

多模态大型语言模型越来越能够进行复杂的推理,但当它们必须通过工具将问题具体化,然后对工具的输出进行推理时,特别是当它们依赖视觉辅助时,它们的性能通常会下降。这种差距尤其重要,因为真正的工程和科学工作流程通常依赖可视化工具进行分析、验证和决策。为了研究这种差异,我们引入了 VAMPS(视觉辅助数学问题解决),它是图辅助数学的基准。 VAMPS 包含 1,168 个从伊朗大学入学考试代数和微积分问题中提取的多模态、双语多项选择题答案对,并通过人工审查的 LLM 生成的合成变体进行扩展,所有选择都经过选择,以便绘图通过揭示交集、极值、渐近线等提供自然的解决策略。VAMPS 专为基准测试和诊断而设计,超越了以前的多模态基准,这些基准主要通过测试模型是否可以评估固定视觉输入的推理。受益于构建有用的图表并将其答案基于生成的可视化结果。总体而言,我们发现,在一组不同的模型中,直接分析求解的性能出人意料地优于工具支持的视觉求解,即使对于绘图是自然策略的问题也是如此。

VAMPS:视觉辅助数学问题解决基准:论文配图
图 3:针对两个问题运行工具启用的说明性 VAMPS 轨迹,这两个问题均由 Claude Opus 4.7 解决。左图:在问题 186 中,模型在启用 label_extrema 的情况下发出单个 desmos_plot 调用,从返回的屏幕截图中读取带标签的极值坐标,并选择正确的选项。右图:在问题 199 中,模型将目标表达式与多个候选答案一起绘制,但误读了 (π/2,π)(\pi/2,\pi) 上的视觉重叠并选择了错误的选项。