论文

具有反事实可控性的自主视频生成,用于自我演化的世界模型

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

模型评测评测方法与指标

摘要

大规模视频生成模型越来越多地被描述为世界模型,因为它们可以从视觉数据中学习丰富的时空规律。然而,我们认为理想的世界模型应该受益于自我进化的生成特征。仅凭传统的视觉上合理的预测不足以确定想象的未来对于特定的具体主体而言是否可行,无法从环境中提供信息反馈以进行自我进化的改进。为了实现自我进化的世界模型,本文提出了自主视频生成的概念,它通过反事实可控性进行评估,即i)生成干预条件未来的能力,ii)将这些未来框架与实施例约束绑定,iii)在分布变化下验证它们,iv)将幸存分支提炼为紧凑变量以进行决策的能力。我们形式化了生成、绑定、验证和 蒸馏 的四阶段闭环优化,以及四个相应的评估指标:新颖性、一致性、分布外(OOD)和效率。我们进一步讨论两个例子,即无人机和机械手,作为早期体现的测试平台,可以系统地扰动和验证风、传感限制、驱动延迟、接触动力学和恢复约束。核心主张是,自我进化世界模型的自主视频生成框架不应仅根据视频保真度来判断,而应根据生成的帧是否在反事实干预和各种实施例约束下改善有效行动来判断。