论文
MUSE:通过基于内存的增量需求满足进行代理 3D 场景创作
MUSE: Agentic 3D Scene Authoring via Memory-Grounded Incremental Requirement Satisfaction
摘要
文本驱动的 3D 场景生成是一种很有前途的技术,适用于数字内容创建、具体人工智能模拟和交互设计,但实际工作流程通常需要精炼、扩展或纠正现有场景,同时保留非目标内容。现有方法可以生成逼真且结构合理的场景,但它们通常缺乏需求级状态跟踪的可编辑性,因此部分级故障通常会导致全场景重新生成或手动干预。为了应对这一挑战,我们将可控 3D 场景创作制定为增量需求满足,统一构建和编辑。在本文中,我们提出了 MUSE,一个基于内存的多代理框架,其中架构师将指令编译为结构化需求,雕塑家执行本地场景操作,检查员在更新工作、场景和技能内存时验证每个步骤。为了评估需求级的可控性和保存感知编辑,我们引入了 AuthorBench,提供 145 个约束构造案例和 1,584 个案例保存感知编辑池,并配有外部结构化检查。在完整的施工案例中,MUSE 将所有目标成功率从 37.9 提高到 80.7,将表面约束实现率从 35.0 提高到 92.6(超过最强基线)。在分层的 240 例编辑测试中,MUSE 实现了 49.6 的全目标成功率、99.9 的保留率和只有 0.6 的意外更改率。除了自动化指标之外,对本地编辑基线进行比较的人工评估支持与用户意图更强的一致性,下游导航代理测试表明更强的空间稳定性。结合验证我们内存设计的消融,这些结果将 MUSE 确立为可控 3D 场景创作的有效框架。