论文
VAMPS:视觉辅助数学问题解决基准
VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark
摘要
多模态大型语言模型越来越能够进行复杂的推理,但当它们必须通过工具将问题具体化,然后对工具的输出进行推理时,特别是当它们依赖视觉辅助时,它们的性能通常会下降。这种差距尤其重要,因为真正的工程和科学工作流程通常依赖可视化工具进行分析、验证和决策。为了研究这种差异,我们引入了 VAMPS(视觉辅助数学问题解决),它是图辅助数学的基准。 VAMPS 包含 1,168 个从伊朗大学入学考试代数和微积分问题中提取的多模态、双语多项选择题答案对,并通过人工审查的 LLM 生成的合成变体进行扩展,所有选择都经过选择,以便绘图通过揭示交集、极值、渐近线等提供自然的解决策略。VAMPS 专为基准测试和诊断而设计,超越了以前的多模态基准,这些基准主要通过测试模型是否可以评估固定视觉输入的推理。受益于构建有用的图表并将其答案基于生成的可视化结果。总体而言,我们发现,在一组不同的模型中,直接分析求解的性能出人意料地优于工具支持的视觉求解,即使对于绘图是自然策略的问题也是如此。
