论文
3D 大语言模型真的理解3D空间关系吗?
Do 3D Large Language Models Really Understand 3D Spatial Relationships?
摘要
最近的 3D 大语言模型 (3D-LLM) 声称可以理解 3D 世界,尤其是对象之间的空间关系。然而,我们发现仅使用 微调 纯文本问答对的语言模型就可以在 SQA3D 基准测试上媲美甚至超越这些方法,而无需使用任何 3D 输入。这表明 SQA3D 基准测试可能无法检测模型是否利用文本快捷方式而不是进行 3D 感知推理。为了解决这个问题,我们引入了 Real-3DQA,这是一种更严格的评估基准,可以过滤掉容易猜测的问题,并引入结构化分类法来评估 3D 推理的各个方面。 Real-3DQA 的实验证实,一旦删除简单的线索,现有的 3D-LLM 就会难以处理空间关系。我们进一步提出了一个 3D 重新加权训练目标,引导模型更多地依赖 3D 视觉线索,显着增强 3D-LLM 在空间推理任务中的性能。我们的研究结果强调需要强大的基准和量身定制的训练策略来促进真正的 3D 视觉语言理解。项目页面:https://real-3dqa.github.io/。