论文
世界推理竞技场
World Reasoning Arena
摘要
世界模型 (WM) 旨在充当现实世界的内部模拟器,使代理能够理解、预测复杂环境并采取行动。现有的 WM 基准仍然狭隘地关注下一状态预测和视觉保真度,忽视了智能行为所需的更丰富的模拟功能。为了解决这一差距,我们引入了 WR-Arena,这是一个综合基准,用于沿着下一个世界模拟的三个基本维度评估 WM:(i)动作模拟保真度,解释和遵循语义上有意义的多步骤指令并生成各种反事实滚动模拟的能力; (ii) 长期预测,即在扩展的交互过程中维持准确、连贯且物理上合理的模拟的能力; (iii) 模拟推理和规划,通过在结构化和开放式环境中模拟、比较和选择替代未来来支持目标导向推理的能力。我们构建了一个任务分类法并整理了旨在探索这些功能的各种数据集,超越了单轮和感知评估。通过对最先进的 WM 进行广泛的实验,我们的结果揭示了当前模型与人类水平的假设推理之间的巨大差距,并将 WR-Arena 建立为诊断工具和指南,以推进能够强大理解、预测和有目的行动的下一代世界模型。代码可在 https://github.com/MBZUAI-IFM/WR-Arena 获取。