论文
H3-World:将语言理解变成世界控制
H3-World: Turning Language Understanding into World Control
摘要
我们推出了 H3-World,这是一个高效的框架,可将 33B MiniMax-H3 视频生成器转变为交互式世界模型。我们的主要发现是,随着大型视频生成器的功能变得越来越强大,语言正在成为一种自然的控制界面。例如,MiniMax-H3 已经支持通过自然语言指令对角色行为和摄像机运动进行零镜头控制。在此基础上,H3-World 将这种粗糙的语言界面转变为精确的、基于时间的世界控制,而无需引入专用的动作模块。具体来说,我们将每个动作表示为角色和摄像机指令的结构化组合,并将它们与相应的时间视频潜伏对齐。为了使控制在时间上精确,我们进一步引入时间注意路由,它将每条指令限制在其预期的时间间隔内,并减少动作之间的控制泄漏。重要的是,H3-World 直接重用大规模视频预训练过程中学到的语义表示,只需要轻量级的适配。只需 8,000 个游戏样本、10,000 个 LoRA 优化步骤和 0.199% 可训练参数,H3-World 即可实现有效的角色和摄像机控制,同时保持强大的生成质量。它还可以推广到未见过的场景。这些结果表明,大型视频生成器中出现的控制能力可以有效地转化为交互式世界控制。