论文

SceneMosaic:通过混合代理布局演进生成高效且多样化的模拟就绪场景

SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution

应用与实践内容创作

摘要

多样化且可模拟的室内场景对于互动娱乐和嵌入式人工智能至关重要,但其可扩展的生成仍然具有挑战性。最近依赖视觉语言模型 (VLM) 的代理文本到 3D 场景管道可以生成高保真度的场景,但需要昂贵的迭代对象放置和细化。另一种主流范式是参数化图像到 3D 场景模型,它可以根据从 2D 图像中学习到的强先验知识有效地生成场景,但通常会导致场景不精确且物理上无效。更重要的是,这两种范式都很难为单个输入输出不同的场景,这使得它们很难反映真实场景的动态变化性质。在本文中,我们提出了 \textbf{SceneMosaic},一个结合了两种范式优点的框架。它从学习的基于图像的先验中获得初始候选,然后通过 VLM 代理演化结果,确保效率和物理有效性。在进化过程中,SceneMosaic利用自然场景的局部性,将场景分解为独立的局部单元,允许每个单元内单独进化,然后通过笛卡尔积组成全局场景。在 SceneEval-100 上,SceneMosaic 在语义布局质量方面匹配了最强的代理基线,加速速度提高了 24 倍,大大减少了物理违规,并获得了最高的人类评级。我们的代码可在 https://github.com/rxjfighting/SceneMosaic 上公开获取。