论文

EchoWM:开放且可输入的全模式世界模型

EchoWM: Open and Enterable Omnimodal World Models

模型训练预训练

摘要

我们推出了 EchoWM,这是一种用于可输入生成媒体的全模式世界模型,它响应连续导航,同时共同生成 720p 视频、环境声音、音乐和语音。我们围绕相机意图组织交互:在第一人称场景中,它指定观察者运动,而在第三人称场景中,相机-角色动态是从没有特定于视图的控制器的数据中学习的。离散命令和连续姿势被映射到共享的公制尺度相对 6-DoF 轨迹,数据集级校准保留跨异构数据的运动幅度。为了共同学习视听生成和轨迹控制,我们构建了一个互补的数据引擎,并采用渐进式训练,然后采用自回归 后训练 进行长视野生成。广泛的评估表明,\model 在公共世界模型基准上实现了强大的轨迹跟踪和高视觉质量,支持跨不同主题的第一人称和第三人称交互,并在长视野生成中保持同步的环境声音和语音。