论文
iWorld-Bench:具有统一动作生成框架的交互式世界模型的基准
iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework
摘要
实现通用人工智能 (AGI) 需要智能体能够自适应地学习和交互,并通过交互式世界模型为感知、推理和行动提供可扩展的环境。然而目前的研究仍然缺乏大规模的数据集和统一的基准来评估它们的物理交互能力。为了解决这个问题,我们提出了 iWorld-Bench,这是一个用于训练和测试距离感知和记忆等交互相关能力的世界模型的综合基准。我们构建了一个包含 330k 视频片段的多样化数据集,并选择了 2100 个涵盖不同视角、天气和场景的高质量样本。由于现有的世界模型在交互方式上有所不同,我们引入了一个动作生成框架来统一评估和设计六种任务类型,生成 4.9k 测试样本。这些任务共同评估视觉生成、轨迹跟踪和记忆方面的模型性能。通过评估 14 个具有代表性的世界模型,我们确定了关键局限性并为未来的研究提供了见解。 iWorld-Bench 模型排行榜可在 iWorld-Bench.com 上公开获取。