论文

ScenePilot:文本驱动的 3D 室内场景生成的增长和修复策略

ScenePilot: Grow-and-Repair Policy for Text-Driven 3D Indoor Scene Generation

智能体系统Agent 架构与控制循环

摘要

文本驱动的 3D 室内场景生成已从数据集绑定的布局建模发展到使用大型语言和视觉语言模型的开放词汇合成。然而现有的方法仍然有限:一次性生成器通常会产生几何上无效的布局,大量事后优化成本高昂且不稳定,并且仅提示规划器缺乏用于功能分组和对象关系的可重用布局先验。我们提出了 \textbf{ScenePilot},一个检索增强的 \textbf{Grow-and-Repair} 框架,它将场景生成制定为带有学习校正的先验引导增量增长。根据提示,分层检索增强规划 (HRAP) 模块会检索房间、组和锚点级别的先验布局,以支持功能组规划。然后,文本驱动的基础生成器按顺序插入对象组,而强化多模态修复 (RMR) 模块在每次插入后执行轻量级局部校正,并在完成后执行最终全局修复。为了训练这个策略,我们构建了 \textbf{SceneReverse-17k},这是一个修复轨迹数据集,通过扰动高质量 3D 场景的位置、旋转和缩放来构建,然后使用逆运算作为可执行的校正目标。该策略根据渲染视图、场景状态、检索到的先验和编辑历史来预测结构化的 \emph{move--rotate--scale} 动作。通过将 HRAP 与 RMR 相结合,ScenePilot 为一次性生成和大量全场景优化提供了一种有效的替代方案,在保留多样性的同时提高了物理合理性、功能一致性和可控性。