论文
VideoWeaver:用于实体代理的多模式多视图视频到视频传输
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents
摘要
视频到视频 (V2V) 翻译的最新进展实现了对具身AI 演示的真实重新模拟,这种功能允许将预训练的机器人策略转移到新环境,而无需额外收集数据。然而,之前的工作一次只能在单个视图上运行,而具体的人工智能任务通常是从多个同步摄像机捕获的,以支持策略学习。天真地将单视图模型独立地应用于每个摄像机会导致视图之间的外观不一致,并且由于跨视图注意力的二次成本,标准 Transformer 架构无法扩展到多视图设置。我们推出了 VideoWeaver,第一个多模式多视图 V2V 翻译框架。 VideoWeaver 最初被训练为基于单视图流的 V2V 模型。为了实现对多视图体系的扩展,我们建议将所有视图置于从前馈空间基础模型(即 Pi3)派生的共享 4D 潜在空间中。即使在宽基线和动态相机运动下,这也能保证视图一致的外观。为了超出固定数量的摄像机,我们以不同的扩散时间步长训练视图,使模型能够学习联合视图分布和条件视图分布。这反过来又允许以现有观点为条件的新观点的自回归综合。实验表明,在单视图翻译基准上,性能优于或相似于最先进的性能,并且首次实现了物理和风格上一致的多视图翻译,包括具有挑战性的自我中心和异构相机设置,这对于机器人学习的世界随机化至关重要。