论文
RoboLayout:面向具身智能体的可微3D场景生成
RoboLayout: Differentiable 3D Scene Generation for Embodied Agents
摘要
视觉语言模型(VLM)的最新进展展现出从开放式语言指令进行空间推理与3D场景布局生成的强大潜力。然而,生成既语义连贯、又可供具身智能体交互的可行布局仍具挑战,尤其在物理受限的室内环境中。本文提出RoboLayout,作为LayoutVLM的扩展,为原框架加入智能体感知推理与更优的优化稳定性。RoboLayout把显式可达性约束融入可微布局优化过程,使生成的布局可被具身智能体导航与操作。重要的是,智能体抽象不限于特定机器人平台,可表示具有不同物理能力的多样实体,如服务机器人、仓储机器人、不同年龄段的人或动物,使环境设计能按目标智能体定制。此外提出局部精修阶段,只对有问题的物体摆放做再优化而保持场景其余部分固定,在不增加全局优化迭代的情况下提升收敛效率。总体而言,RoboLayout在保持LayoutVLM强语义对齐与物理合理性的同时,增强了对以智能体为中心的室内场景生成的适用性,多样场景配置下的实验结果证明了这一点。
