论文
PolyComp:多模态模型中基于 Polycube 的组合 3D 空间推理基准
PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models
摘要
我们引入了 PolyComp,这是一个程序生成和验证的基准,强调视觉识别和组合空间推理。在每个问题中,模型必须确定四个选项中的哪一个显示可以组合形成目标实体的一对多立方体组件。该基准测试包含跨越四个几何系列的 120 个问题,每个问题都有三种不同的呈现格式,使用单个图像或多个图像。随机猜测基线为 25%。在三个演示中(每个模型 360 个提出的问题),GPT-5.6 Sol 以最大努力达到 50.0% 的准确率(95% 问题集群 CI 43.3-56.7%),每个提出问题的平均成本为 0.951 美元,Claude Fable 5 以最大努力以 0.701 美元达到 39.4% (33.1-46.1%),而 Gemini思维水平较高的 3.1 Pro Preview 达到 27.5% (22.8-32.5%),接近 25% 随机猜测基线,价格为 0.350 美元。观察到的跨几何族的准确度大于跨演示格式的准确度。我们提出了问题开发和评估协议、成本和词元核算,并发布了 120 个问题。