论文
ELSA3D:用于统一 3D 理解和生成的弹性语义锚定
ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation
摘要
统一的 3D 基础模型渴望生成 3D 资产并在单个主干中用语言对其进行推理,但它们的文本-3D 交互在很大程度上仍然是隐式的。现有方法将文本和 3D 标记连接成一个平面序列,并依赖于自注意力,将粗糙的结构线索和精细的几何细节折叠成一个无差别的表示。我们引入了 ELSA3D,这是一种统一的 3D 模型,它通过弹性语义锚定、结构化语言和几何推理沿着匹配的抽象尺度共同解决这个问题。 ELSA3D 使用尺度感知八叉树分词器来表示几何,并引入锚标记,即选择语义线索的稀疏跨模态单元,将它们路由到最相关的 3D 尺度,检索特定于尺度的几何证据,并将融合信号写回到统一表示中,从而保持交互稀疏而精确。轻量级的每块路由器使计算和推理都具有弹性,选择哪些文本标记在哪个几何尺度上实例化锚点,以便跨模式能力集中在最需要对齐的地方。 ELSA3D 在图像到 3D 生成、文本到 3D 生成和 3D 字幕方面实现了最先进的性能,超越了最强的统一基线,同时相对于同一模型的非弹性版本,将 FLOP 和推理延迟大致减半。