论文

EVA01:通过 Transformer 的混合实现统一的原生 3D 理解和生成

EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers

摘要

本文解决了将 3D 网格集成为 Multimodal 大语言模型 (MLLM) 中的本机模态的挑战。基于扩散的大型重建模型将语义理解与几何推理分离,作为以密集 2D 像素先验为条件的无状态重建器运行。最近基于 MLLM 的方法将 3D 模态视为外部输出,而不是多模态序列的本机组件,从而在没有系统分析几何流形如何与 MLLM 特征空间对齐的情况下进行增量调整。我们推出了 EVA01,这是一个统一的框架,它扩展了 MLLM 的模态边界,以原生整合 3D 网格理解、生成和上下文感知编辑。 EVA01 基于 Mixture-of-Transformer (MoT) 架构构建,将模型解耦为预训练的理解专家 ($E_{\mathrm{und}}$) 和结构镜像的生成专家 ($E_{\mathrm{gen}}$),通过共享全局自注意力与硬模态路由进行耦合。该设计将 MLLM 主干的语义潜在空间与几何流形对齐,从而无需中间 2D 表示即可直接传输多模态先验。结果表明,EVA01 实现了最先进的本机文本到 3D 生成保真度,并通过身份保留解锁了强大的长上下文多轮几何编辑,这是无状态重建管道根本无法访问的功能。我们的研究结果进一步提供了将 2D 基础模型与 3D 任务集成的架构见解,为 3D 原生多模态系统的设计提供信息。项目页面:https://www.seeles.ai/research/pages/EVA01