论文

MeshFM:理解 3D 形状所需的全部是 2D 特征

MeshFM: 2D Features Are All You Need for 3D Shape Understanding

摘要

我们提出了 MeshFM,这是一种高效的前馈框架,用于从 3D 输入中提取丰富的特征。我们的方法将视觉基础模型中的 2D 特征提取为 3D。我们训练前馈网络直接预测 3D 特征,无需在推理过程中进行优化。该方法采用两阶段训练策略。首先,我们仅使用 2D 特征监督来优化 3D 特征场。其次,我们训练一个网络来回归这个特征字段。整个过程不需要 3D 注释,而是依赖 2D 基础模型中的强大信息。我们证明,我们学到的特征可以立即应用于下游任务,包括零件分割、密集对应和网格变形。大量实验表明,仅使用 2D 监督进行训练的 MeshFM 的性能与使用 3D 监督进行显式训练的方法相当,即使没有特定于任务的 微调。此外,我们的模型经过训练,对输入对象的极端旋转具有鲁棒性。项目页面:https://tridle.github.io/MeshFM/