论文
会解不等于会画:一个面向奥赛几何图示推理的基准
Solving Is Not Drawing: A Benchmark for Diagrammatic Reasoning in Olympiad Geometry
摘要
GPT、Claude等基础模型如今能以惊人的熟练度求解奥赛级数学题,以至于几何问题求解已成为衡量其数学推理能力的标准代理。然而,解出一道几何题与画出它所依赖的图形并不是同一种技能:解题进展往往取决于一张包含正确辅助构造和关联关系的忠实图形,而一个能推理出答案的模型是否也能画出这样的图形,目前尚不清楚。包括MathVista和MathVerse在内的一批基准衡量模型是否得到正确答案,但据我们所知,没有任何基准单独隔离出构建图形本身这一独特能力,使这一能力处于未被测量的状态。我们提出一个开源基准来填补这一空白:954道自成体系的奥赛几何题,含297道题的困难子集,每题配有解答和一份由人工编写、以可渲染Asymptote代码表示的高保真图形,并配套一套文本、代码、图像、VLM和约束类指标,用于衡量我们所说的“图示推理”。对当前基础模型的评估揭示了会解题与会作图之间的显著鸿沟:模型画出的图形保真度明显更低,平均编译成功率仅为36.14%。我们发现,强大的数学推理能力并不意味着能构建准确的几何图形。基准与数据集可在https://huggingface.co/datasets/max98765/hard_geometry_problems_with_diagrams获取。
