论文
空间能力基准
Spatial Competence Benchmark
摘要
空间能力是维持一致的环境内部表示并利用它在约束下推断离散结构、规划行动的品质。现有针对大型模型的主流空间评估局限于通过3D变换或视觉问答探测孤立的原语。我们提出Spatial Competence Benchmark(SCBench),覆盖三个层级化的能力桶,其任务要求可执行输出,由确定性检查器或基于仿真的评估器验证。在SCBench上,三个前沿模型沿能力阶梯呈现单调下降的准确率。对输出token上限的扫描表明,准确率收益集中在低预算区并快速饱和,失败主要由破坏全局约束的局部合理几何主导。我们发布任务生成器、验证器和可视化工具。
