论文

SimWorlds:面向动态3D场景创建的多智能体系统

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

应用与实践内容创作

摘要

LLM智能体日益被用于以程序化方式将自然语言翻译为3D场景——但既有系统聚焦静态输出。仅凭文本的动态4D场景——液体流动、粒子发射、刚体级联与铰接机构运动——作为可编辑内容及视频生成与具身AI的物理锚定训练数据极具价值——却基本未被探索。两个挑战使动态情形区别于静态文生场景工作:智能体必须在单一连贯场景中联合协调空间布局、多个物理求解器、时序、相机与灯光;且从渲染视频验证运动正确性根本难于判断单张图像。我们提出SimWorlds——从文本产生动态可编辑4D场景的多智能体框架——带Blender特定程序化知识、驱动固定有序构建阶段的规划器-编码者-审查者工作流、由确定性验证器强制的分层场景协议——以及捕获渲染图像无法揭示的机构失败的运行时状态检查工具套件。我们还介绍4DBuildBench——评估从文本提示生成的程序化动态3D场景的视觉保真度与物理一致性的基准。实验表明SimWorlds超越既有动态Blender生成基线。

SimWorlds:面向动态3D场景创建的多智能体系统:论文配图
图 1:SimWorlds 将文本转换为动态、可编辑的 3D Blender 场景。在自然语言提示下,规划者、编码员和审阅者合作发出 .blend,其几何形状、材质、照明、相机和运动均保持可控,以供下游编辑和重用。