论文

HOG-Layout:通过视觉语言模型进行分层 3D 场景生成、优化和编辑

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

应用与实践内容创作

摘要

3D 布局生成和编辑在 Embodied AI 和沉浸式 VR 交互中发挥着至关重要的作用。然而,手动创建需要繁琐的劳动,而数据驱动的生成往往缺乏多样性。大型模型的出现为3D场景合成带来了新的可能性。我们提出了 HOG-Layout,它可以使用 大语言模型 (LLM) 和视觉语言模型 (VLM) 实现文本驱动的分层场景生成、优化和实时场景编辑。 HOG-Layout通过检索增强生成(RAG)技术提高场景语义一致性和合理性,并结合优化模块增强物理一致性,并采用分层表示增强推理和优化,实现实时编辑。实验结果表明,与现有基线相比,HOG-Layout 可以生成更合理的环境,同时支持快速直观的场景编辑。