论文
WorldArena 2.0:扩展形态、功能和平台的具体世界模型基准测试
WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform
摘要
世界模型已经成为体现智能的核心范式,使智能体能够预测以行动为条件的未来并推理环境动态。然而,现有的体现世界模型基准仍然很大程度上局限于仅视觉预测、离线体现应用和基于模拟器的评估,这使得它们不足以评估日益全面的世界模型。在这项工作中,我们引入了 WorldArena 2.0,这是一个扩展的基准,它沿着三个维度系统地扩展了具体世界模型评估:模态、功能和平台。在模态维度上,WorldArena 2.0 将评估从仅视觉模态扩展到视觉触觉模态,从而能够评估多模态感知和预测。在功能维度上,它超越了政策评估和规划,将世界模型评估为用于政策优化的交互式强化学习环境。沿着平台维度,它超越了仅模拟器评估,过渡到跨多个实施例的各种模拟和现实世界机器人设置。在标准化协议下,WorldArena 2.0 全面评估感知质量、交互效用和跨平台性能,为跟踪具体世界模型的进展提供全面的测试平台。该基准可在以下网址获取:https://world-arena.ai。