论文
SimWorlds:面向动态3D场景创建的多智能体系统
SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
摘要
LLM智能体日益被用于以程序化方式将自然语言翻译为3D场景——但既有系统聚焦静态输出。仅凭文本的动态4D场景——液体流动、粒子发射、刚体级联与铰接机构运动——作为可编辑内容及视频生成与具身AI的物理锚定训练数据极具价值——却基本未被探索。两个挑战使动态情形区别于静态文生场景工作:智能体必须在单一连贯场景中联合协调空间布局、多个物理求解器、时序、相机与灯光;且从渲染视频验证运动正确性根本难于判断单张图像。我们提出SimWorlds——从文本产生动态可编辑4D场景的多智能体框架——带Blender特定程序化知识、驱动固定有序构建阶段的规划器-编码者-审查者工作流、由确定性验证器强制的分层场景协议——以及捕获渲染图像无法揭示的机构失败的运行时状态检查工具套件。我们还介绍4DBuildBench——评估从文本提示生成的程序化动态3D场景的视觉保真度与物理一致性的基准。实验表明SimWorlds超越既有动态Blender生成基线。
