论文
GraphWrit3R:直接把三维表示写为场景图
GraphWrit3R: End-to-End 3D Scene Graph Writing
摘要
3D 场景图通过对对象、其语义属性以及它们之间的空间和功能关系进行编码,提供复杂环境的结构化表示。当前的 3D 场景图生成方法存在几个基本限制。它们依赖于具有显式中间表示的复杂多级管道,使系统脆弱且容易发生错误传播。他们假设在推理过程中可以访问真实的对象注释,这与现实世界的场景不同。它们依赖于专有模型,阻碍开源部署,或者导致推理速度过慢。我们提出了 GraphWrit3R,这是一种简单的端到端方法,它采用 3D 点云、高斯 Splats 或两者的组合作为输入,并直接将完整的场景图输出为结构化 JSON 脚本。该图列出了所有对象、它们的语义属性以及它们之间的关系,同时避免了上述所有限制。多种输入模式的选择纯粹是为了多功能性,允许一组权重处理不同的场景。点云输入通过 Sonata 编码,并通过 Chorus 输入 Gaussian Splat,两种模态都投影到共享体素网格上,并通过新颖的每体素对比对齐损失进行融合,然后由大型语言模型解码。作为 LLM 的自然结果,GraphWrit3R 还支持开放词汇表查询。在 3DSSG 基准上,我们的方法在对象类、谓词和三元组召回方面实现了最先进的性能,优于在推理过程中依赖真实对象注释的方法。我们进一步提供定性结果并分析不同的输入模态配置、对比损失公式和词元融合策略。
