论文
InHabit:利用图像基础模型实现可扩展的 3D 人体放置
InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement
摘要
训练实体代理像人类一样理解 3D 场景需要人们与不同环境进行有意义交互的大规模数据,但此类数据很少。现实世界的捕获成本高昂且仅限于受控设置,而现有的合成数据集依赖于简单的几何启发式方法,忽略了丰富的场景上下文。相比之下,在互联网规模上训练的二维基础模型已经获得了人类与环境交互的常识知识。为了将这些知识转移到 3D,我们引入了 InHabit,这是一种自动且可扩展的数据生成器,用于填充人类交互的 3D 场景。 InHabit 遵循渲染-生成-提升原则:给定渲染的 3D 场景,视觉语言模型提出上下文有意义的动作,图像编辑模型插入人类,优化程序将编辑结果提升为与场景几何形状对齐的物理合理的 SMPL-X 实体。 InHabit 应用于 Habitat-Matterport3D 后,生成了 InHabitants,这是第一个大规模真实感 3D 人体场景交互数据集,其中包含 78K 样本,涵盖 $\sim$800 的建筑规模场景,具有完整的 3D 几何结构、SMPL-X 主体和图像。使用 InHabitants 增强标准训练数据改进了基于 RGB 的 3D 人类场景重建和接触估计,并且在感知用户研究中,我们的数据在 78% 的情况下优于现有技术。