论文

会解不等于会画:一个面向奥赛几何图示推理的基准

Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry

模型评测基准与评测资源

摘要

GPT、Claude等基础模型如今能以惊人的熟练度求解奥赛级数学题,以至于几何问题求解已成为衡量其数学推理能力的标准代理。然而,解出一道几何题与画出它所依赖的图形并不是同一种技能:解题进展往往取决于一张包含正确辅助构造和关联关系的忠实图形,而一个能推理出答案的模型是否也能画出这样的图形,目前尚不清楚。包括MathVista和MathVerse在内的一批基准衡量模型是否得到正确答案,但据我们所知,没有任何基准单独隔离出构建图形本身这一独特能力,使这一能力处于未被测量的状态。我们提出一个开源基准来填补这一空白:954道自成体系的奥赛几何题,含297道题的困难子集,每题配有解答和一份由人工编写、以可渲染Asymptote代码表示的高保真图形,并配套一套文本、代码、图像、VLM和约束类指标,用于衡量我们所说的“图示推理”。对当前基础模型的评估揭示了会解题与会作图之间的显著鸿沟:模型画出的图形保真度明显更低,平均编译成功率仅为36.14%。我们发现,强大的数学推理能力并不意味着能构建准确的几何图形。基准与数据集可在https://huggingface.co/datasets/max98765/hard_geometry_problems_with_diagrams获取。

会解不等于会画:一个面向奥赛几何图示推理的基准:论文配图
图1:数据整理与评估流程概览。我们从网络抓取高质量数学奥林匹克题目,即来自解法记录完善的国家及国际赛事的题目。随后提取人工编写的 Asymptote 代码,生成与每份解答对应的图形。为构建数据集,我们对数据过滤,剔除不自含或非几何的问题。然后提示 GPT-5.4-mini 为每份解答生成难度评分与方法概要,以供进一步分析。利用难度截断值,我们精选出更难的几何问题子集。我们在一系列指标上以两种不同实验设置评估基础模型:1) 仅含题面的基线;2) 额外包含完整参考解答与方法。