论文

Ego2Act:评估以自我为中心的视频生成中的目标导向操作

Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation

模型评测基准与评测资源

摘要

视频生成模型越来越多地被探索为用于具体规划和学习的世界模拟器。为了有效地做到这一点,这些模型不仅必须生成视觉上吸引人的框架,而且还要预测在执行目标导向的行动时环境如何动态演变。虽然评估这些功能至关重要,但现有的基准测试主要关注单个简短操作或分步指令。这使得多步骤物理推理尚未得到充分探索,特别是在以自我为中心的视频生成中,需要计划模拟正确的执行,以通过执行多个现实世界的操作来实现高级目标。我们推出了 Ego2Act,这是一个目标导向的基准测试,包含来自 110 个现实世界任务的 2,640 个视频,涵盖日常设置、不同的对象混乱度和多步骤复杂性。给定初始场景图像和高级目标,Ego2Act 评估视频生成模型是否可以生成手操纵物体以执行任务的逼真的以自我为中心的视频。为了支持可扩展的评估,我们还引入了 Ego2ActJudge,这是一种无参考评估管道,与相关基线相比,它可以更好地完成任务,并使物理合理性评估与人类共识保持一致。我们的研究结果表明,模型生成的模拟经常跳过或部分执行步骤,导致后续步骤缺少依赖状态,从而导致目标未实现。此外,模型在细粒度物理动力学方面始终失败,特别是在复杂的对象操作和持久世界建模期间。我们希望 Ego2Act 提供一个严格的测试平台,用于将视频模型推进到物理上合理的、目标导向的模拟。