论文
ThinkBLOX:使用渐进式推理生成 3D 室内场景
ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning
摘要
虽然传统的图形方法通常以自回归或分层方式合成 3D 室内场景,但最近基于视觉语言模型 (VLM) 的生成器主要采用一次性范例,即一次规划完整布局。这种一次性方法通常需要在交互式编辑(例如,插入或移动对象)期间进行全局重新优化或完全重建,并且可能导致物理或语义上组织不良的安排。为了应对这些挑战,我们提出了 ThinkBLOX,这是一种基于 VLM 的渐进推理框架,可以迭代地设计和细化 3D 场景。 ThinkBLOX 将布局生成视为一个以状态为条件的、逐步推理和操作的过程。为此,我们构建了 ThinkBLOX-Data-200K 数据集,其中包含 224,757 个程序放置对,并用多视图场景上下文、明确的思想链 (CoT) 基本原理和结构化 JSON 布局进行注释。通过对该数据集的监督 微调 (SFT),VLM 学会在增量更新下弥合推理与动作之间的差距。此外,认识到场景合成本质上是一个多解决方案任务,SFT 会遭受奖励冲突,因此我们引入了分层解耦 GDPO。这种强化学习方案将异构奖励组织成不同的层,从而在物理有效性、语义合理性和推理-行动一致性方面稳定策略优化。大量实验表明,ThinkBLOX 在物理合理性、语义对齐和交互式可编辑性方面显着优于最近的一次性和迭代基线。此外,我们还表明它支持多种应用,包括全局和本地生成以及 3D 场景的重新排列。