论文

NoReGeo:非推理几何基准

NoReGeo: Non-Reasoning Geometry Benchmark

模型评测基准与评测资源

摘要

我们提出 NoReGeo,一个新颖的基准,旨在评估大语言模型(LLM)在不依赖推理或代数计算的情况下的内在几何理解。与主要评估模型在基于推理的几何——即用代数方法推导解答——上的熟练度的现有基准不同,NoReGeo 聚焦于评估 LLM 能否直接地、内在地编码空间关系并识别几何属性。该基准包含 2,500 道覆盖 25 个类别的平凡几何问题,每道题都经过精心设计,可在假设物体位置已知的前提下仅凭原生几何理解求解。我们在 NoReGeo 上评估了一系列最先进模型,包括 GPT-4 等前沿模型,观察到即便最先进的系统在二分类任务中的总体准确率上限也只有 65%。此外,消融实验表明这种几何理解无法仅凭微调产生,说明针对几何理解的有效训练从一开始就需要专门的方法。我们的发现凸显了当前 LLM 在原生掌握几何概念上的显著差距,为未来迈向具备真正几何认知的模型的研究奠定基础。

NoReGeo:非推理几何基准
图1:来自 NoReGeo 基准的评估样本。每个问题以三种格式展示——(a) 纯文本,(b) 带点状图(仅点)的文本,(c) 带完整图(点加连线)的文本——并同时给出标准答案(黄色)与模型的预测。