论文

DesignAgent3D:通过类似设计师的多模态推理进行交互式 3D 场景编辑

DesignAgent3D: Interactive 3D Scene Editing via Designer-like Multimodal Reasoning

智能体系统Agent 架构与控制循环

摘要

文本引导的 3D 场景编辑提供了用于修改重建环境的直观界面,但仍然很困难,因为自然语言设计请求通常在语义上未指定,并且必须基于杂乱的 3D 场景。现有的方法通常将任务制定为根据单个提示进行一次性条件生成,无法解决模糊的用户意图或实现精确的空间基础。因此,它们会遭受严重的对象定位漂移、遮挡下的跟踪失败以及臭名昭著的多视图“贴纸效应”。为了克服这些限制,我们提出了 DesignAgent3D,这是一种交互式多模式代理框架,它将 3D 场景编辑重新表述为类似设计师的计划-感知-行动范例。代理首先通过与用户交互来制定计划,以阐明未指定的设计目标,然后通过将预期编辑基于 3D 场景中的特定对象或区域来进行感知,最后通过应用受控视觉修改来采取行动,同时保持场景一致性。编辑进一步集成到底层 3D 表示中,支持持久且多视图一致的小说视图渲染。跨 NeRF 和 3D Gaussian Splatting 主干的大量实验表明,DesignAgent3D 显着优于最先进的基线,提供卓越的语义意图对齐、无可挑剔的空间定位精度和高保真多视图一致性。