论文
Perceive-then-Plan:单目 3D 场景布局估计的布局即策略
Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation
摘要
从单个图像构建结构化 3D 场景布局需要协调视觉观察与物理和空间约束,这是一个仅靠直接预测很难解决的挑战。在这项工作中,我们将单目 3D 布局估计表述为视觉语言模型的感知然后规划问题,其中感知器首先对 3D 对象进行基础处理,然后规划器通过提高物理合理性同时保持与输入图像的一致性的操作来迭代地细化场景假设。我们提出布局即策略(LaP),它将规划阶段视为策略学习问题:3D 布局表示为结构化状态,并通过平移、旋转和重新缩放等离散操作进行细化。从使用几何增强型感知器进行观察对齐初始化开始,LaP 规划器经过训练可生成逐步解决几何不一致并加强现实空间关系的动作序列。为了实现有效的学习,我们将监督轨迹初始化与基于偏好的优化相结合,使模型能够学习纠正行为,而不需要明确的奖励工程。这一公式将布局估计从一次性预测任务转变为迭代细化过程,从而能够更好地处理全局约束和复杂的对象交互。实验表明,我们的方法产生的布局在物理上更加连贯,并且与视觉观察更好地保持一致,同时自然地支持场景编辑和操作等下游任务。