论文

HelloWorld:在视频世界模型中启用社交互动角色

HelloWorld: Enabling Socially Interactive Characters in Video World Models

模型训练合成数据

摘要

尽管视频世界模型最近取得了显着的进步,但用户和这些世界中的角色之间的社交互动仍然不受支持。为了填补这一空白,我们推出了 HelloWorld,这是一种视频世界模型,可以与世界中的角色进行社交互动。只需按一下按钮,用户就可以提示屏幕上的角色对摄像机做出反应,例如转向观看者、挥手、点头或说简短的问候。为了使这些交互自然,我们提出了一个自 蒸馏 管道,可以根据自身合成的数据微调视频生成模型。每个合成剪辑都包含社交互动和相机运动,使模型能够学习相机姿势调节,而不会降低交互质量。在推理时,我们进一步引入一个 无需训练 模块来确定交互何时发生。按下按钮后,它会调整 DiT 的交叉注意掩码,以便与交互相关的文本提示仅关注按下窗口内的帧,从而暂时定位角色的响应。我们进一步构建了 HelloWorldBench,这是一个包含 400 个样本的基准测试,其中包含三个社交互动指标以及三个传统指标,以进行评估。实验表明,HelloWorld 在交互质量方面超越了各种基线,同时保持了最先进的画面美学和相机姿势跟踪。项目页面:https://github.com/AlayaLab/HelloWorld