论文

Video2World:基于具体视频的交互式世界建模的基准编码智能体

Video2World: Benchmarking Coding Agents for Interactive World Modeling from Embodied Videos

智能体系统Agent任务评测

摘要

根据现实世界的观察构建交互式模拟器是扩展具体数据的一种有前途的方法,但当前的管道仍然严重依赖于手动环境构建和校准。我们研究前沿基础模型和编码智能体是否可以端到端地自动化这个过程。我们将自主视频到模拟制定为一项软件工程任务,其中智能体观察具体视频,构建相应的模拟环境和机器人行为,并通过执行反馈迭代地细化结果。为了评估这种能力,我们引入了 Video2World,这是一个基准,包含源自 189 个机器人和人类演示视频的 222 个重建实例。 Video2World 根据几何保真度、动态保真度和功能正确性测量重建的世界,捕获空间感知、物理推理和可执行交互。对 9 个前沿编码智能体系统的评估表明,从 Claude Opus 5 开始,任务成功率有了显着改进,从低于 5\% 上升到超过 15\%,但与人工辅助重建仍然存在巨大差距。我们进一步发现,看起来更好的世界可能会更糟:更好的视觉保真度并不总是带来更高的任务成功率。这呼应了生成模型中观察到的感知现实主义和事实正确性之间更大的差距。

Video2World:基于具体视频的交互式世界建模的基准编码智能体的原论文方法或结果图
图 2:Video2World 概述。编码智能体使用视频检查、模拟器 API、资产资源和执行反馈在沙箱中构建场景和机器人行为。提交的重建将根据隐藏的场景几何形状、演示的对象运动和任务要求进行评估。评估分别测量几何保真度、物体运动的动态保真度以及物理执行下的功能正确性。