论文
WorldAuditBench:使用多模态Agent进行交互式 3D 世界审计
WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents
摘要
随着交互式 3D 世界越来越多地用于研究智能行为,开发有效的管道来识别这些模拟环境中的异常情况变得非常重要,例如浮动物体、可穿越的墙壁或与周围场景不一致的物体。多模态人工智能系统,包括视觉语言模型(VLM)和视觉语言动作模型(VLA),已经显示出自动化这项任务的潜力。然而,3D 世界审计很复杂,需要两种不同功能的紧密结合:行动,系统有效地导航 3D 世界并搜索异常;和视觉推理,以了解环境并从多模态观察中识别异常。多模态Agent是否可以有效地将这两种功能结合起来,使用视觉推理来识别潜在的异常,同时采取行动来验证它们,这在很大程度上仍未得到探索。在本文中,我们介绍了 WorldAuditBench,它是 3D 世界审计的基准,包含使用虚幻引擎 5 和 Three.js 构建的 13 个环境中的 213 个异常任务,涵盖五个异常系列。我们使用两种审核范式在固定探索预算下评估五个前沿模型:基于 VLA 的探索,然后是基于 VLM 的异常识别,以及视觉推理直接指导动作选择的端到端 VLM Agent。在评估的模型和两种范式中,成功率范围从 6.6% 到 42.3%,远低于人类表现 (83.4%)。通过世界审计任务,WorldAuditBench 提供了一个测试平台,用于研究多模态Agent如何在交互式 3D 环境中耦合动作和视觉推理,同时强调当前它们在探索过程中收集和解释证据的能力的局限性。