论文
PlanarBench:通过平面图绘制评估 LLM 空间推理
PlanarBench: Evaluating LLM Spatial Reasoning via Planar Graph Drawing
摘要
现有的 LLM 图基准通常要求模型回答图论问题或计算符号解决方案,而不是构建空间布局。任务内的难度也主要按顶点数进行分层。然而,现有的研究还表明,任务难度与边施加的约束数量的关系比与排列的顶点数量的关系更密切。我们引入了 PlanarBench,这是一个基准测试,要求模型在仅给出边列表的情况下生成平面图的无交叉 ASCII 绘图。在 91 个模型配置和 199 个具有 2-7 个顶点的非同构连通平面图中,边数与平均任务得分的相关性比顶点数 ($r=-0.85$) 与 ($r=-0.47$) 的相关性更强,并且在控制顶点数 ($r_p=-0.80$) 后仍然保持很强的相关性。 PlanarBench 提供了用于分离这两个难度轴的受控设置。此外,绘图面积和总响应长度都没有表现出与分数有意义的相关性,这反驳了简单的输出大小解释。性能差异很大:最好的模型得分为 159.5(满分 199),大多数低于 30B 参数的模型得分低于 25,前沿系统中仍然存在大量故障。