论文

VibeWorlding:多模态智能体能端到端构建3D开放世界吗?

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

智能体系统AI 基础设施智能体互操作协议Agent任务评测SandboxMCPAgent Sandbox

摘要

从用户查询构建可交互的3D开放世界很重要。然而,现有方法主要在理想化的简单查询上评估,难以系统分析和比较多模态智能体如何理解用户意图、使用3D工具以及对文本和视觉3D世界信息进行推理。为此,我们提出VibeWorlding,一个用于基准测试和训练vibe worlding智能体的统一框架:这是一类多模态智能体,能在多轮Agent-环境交互中自主推断用户意图、规划场景布局、调用3D工具并对多模态反馈进行反思。为此,我们首先构建VWE-BENCH,一个包含2,616个高质量3D资产、323个人工标注种子3D世界和6,828条反向合成多模态用户查询的基准,分为带真值的已验证查询和带精心设计评分准则(rubric)的未验证查询。此外,我们开发了VibeWorlding-Gym,一个联合多模态RL后训练框架,集成了(1)把资产检索、编辑和图像渲染统一为MCP工具的沙盒环境,以及(2)结合物理可行性与意图满足验证的基于rubric的验证器,支持公平的模型评估和可扩展的多模态RL奖励服务。实验表明,当前前沿MLLM远未能解决vibe worlding智能体任务,即使GPT-5.5和Qwen3.8-Max的成功率也低于60%,瓶颈被追溯到精确的3D世界编辑。我们进一步发现RL训练可缓解这一弱点,并使开源MLLM甚至超越闭源前沿模型:我们的VibeWorlder-8B可与前沿MLLM媲美,旗舰VibeWorlder-30B-A3B在所有被评估模型中取得最佳整体Pass@1。

VibeWorlding:多模态智能体能端到端构建3D开放世界吗?:论文配图
图1:VWE-Bench 与 VibeWorlding-Gym 概览。