论文
GeoBuildBench:通过自然语言构建交互式可执行几何图形的基准
GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language
摘要
我们引入了 GeoBuildBench,这是一个基准测试,旨在评估 大语言模型 和多模态代理是否可以将非正式的自然语言平面几何问题转化为可执行的几何构造。与关注答案正确性或静态图解释的现有几何基准不同,GeoBuildBench 将几何图视为交互式构造任务:给定文本问题,代理必须生成特定于领域的语言 (DSL) 程序来生成满足明确指定的几何对象和可验证约束的图。该基准测试包含 489 个中文教科书式问题,通过自动过滤和人工验证进行整理,以确保文本完整、可构建的问题规范。我们在有界迭代环境中评估了几种最先进的多模态模型,结果表明,尽管成功率合理,但模型经常表现出结构幻觉、丢失对象以及无法满足几何约束,并且利用视觉和基于约束的反馈进行自我校正的能力有限。这些结果强调了几何构造作为严格的测试平台,可以超越文本或视觉的合理性进行有根据的、可执行的推理。我们的基准和代码是公开的。