论文

MathGen:通过文本到图像生成揭示数学能力的幻想

MathGen: Revealing the Illusion of Mathematical Competence through Text-to-Image Generation

模型评测基准与评测资源

摘要

现代生成模型已经证明了解决具有挑战性的数学问题的能力。然而,在许多现实世界中,数学解决方案必须通过图表、绘图、几何构造和结构化符号布局来直观地表达,其中正确性取决于精确的视觉构成。这自然提出了一个问题:当答案必须以视觉方式呈现而不是用文本书写时,生成模型是否仍然可以这样做?为了研究这个问题,我们引入了 MathGen,这是一个涵盖七个核心领域的 420 个问题的严格基准测试,其中包括 350 个干净场景问题和 70 个配对开放场景问题。每个问题都根据“脚本作为法官”协议进行评估,并通过可重用的可执行脚本实现特定于问题的验证标准,以进行确定性和可重复的评估。对代表性开源和专有文本到图像模型的实验表明,数学保真度仍然是一个主要瓶颈:即使是最好的闭源模型也只能达到 53.7% 的总体准确率,而开源模型在结构化任务上只能达到 1--11%,通常接近 0%,特别是那些需要精确几何和功能渲染的任务。总体而言,当前的 T2I 模型即使在基本的数学视觉生成方面也远远不够可靠。