论文

空间能力基准

Spatial Competence Benchmark

模型评测基准与评测资源

摘要

空间能力是维持一致的环境内部表示并利用它在约束下推断离散结构、规划行动的品质。现有针对大型模型的主流空间评估局限于通过3D变换或视觉问答探测孤立的原语。我们提出Spatial Competence Benchmark(SCBench),覆盖三个层级化的能力桶,其任务要求可执行输出,由确定性检查器或基于仿真的评估器验证。在SCBench上,三个前沿模型沿能力阶梯呈现单调下降的准确率。对输出token上限的扫描表明,准确率收益集中在低预算区并快速饱和,失败主要由破坏全局约束的局部合理几何主导。我们发布任务生成器、验证器和可视化工具。

空间能力基准
图1:来自每个任务桶的代表性任务。(a) 在正方形边界上放置两条线段,将内部划分为目标数量的多边形;(b) 在 N × N × N N{\times}N{\times}N 网格中构建一个体素集合,在给定约束下使其向全部三个坐标轴平面的正交投影均被完全填满;(c) 在3D体素世界中修改地形,使降雨模拟产生目标水体构型。