论文

ReRef-3D:空间参考表达引导的 3D 场景重排的基准

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

模型评测基准与评测资源

摘要

我们推出 ReRef-3D,这是 3D 场景中语言引导放置的基准。它包含跨 998 个 CLEVR 派生场景的 33,826 条指令,跨越 16 个布局系列以及直接、一跳和两跳引用。每条指令必须解析为有效的新放置位置。鉴于指令定义了可接受放置的区域而不是一个坐标,我们的评估将预测插入到场景中,重新计算关系,并测试关系满意度和物理有效性。每条指令还包括经过验证的归化重写。在 微调 之后,LLaVA-3D、3D-LLM 和 PlaceIt3D 分别为 68.3%、31.6% 和 22.4% 的指令生成有效布局。在模型中,关系满意度超过了物理有效性,最近和之间等关系是最困难的,措辞对性能的影响最小。