论文
30,000 小时以自我为中心的视频没有教给我们什么
What 30,000 Hours of Ego-centric Video Does Not Teach
摘要
世界模型为基于物理的模拟器提供了一种有前途的替代方案,但距离实际部署还很远。我们使用涵盖 1,000 多个场景类型和 14,000 名贡献者的 30,000 小时的数据集来询问以自我为中心的人类视频的缩放程度。我们不依赖不透明的下游指标,而是在具有挑战性的分布外基准上直接评估代理和对象交互的保真度。将训练数据增加 100 倍可以改善两者,但效果不均匀:代理建模良好,而对象保真度仍然很低且改善缓慢。我们表明,代理增益不需要来自数据,并且仔细的视觉调节设计可以使保真度饱和于其中的一小部分,这使我们可以自行测量对象保真度并发现其饱和点。然后,我们引入了一种监督方案,将容量从场景外观转向对象动态,尽管仍然存在很大差距,但仍提高了对象保真度。最后,我们的结论转移到下游人形建模。总的来说,我们的结果表明,扩展以自我为中心的数据可以带来代理 建模已接近极限,但其对世界的影响却远远落后,而缩小这一差距将取决于模型的训练方式,而不仅仅是模型看到的数据量。