论文

MaineCoon:追求实时视听社交世界模型

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

应用与实践内容创作

摘要

随着越来越多的全球视频内容在社交平台上用于互动社交目的,为社交世界构建的视频生成模型很重要,但在很大程度上被以前的研究所忽视。在这项工作中,我们定义了社会世界模型的位置并构建了原型模型作为实现这一目标的第一步。虽然以前的世界模型成功地模拟了物理环境或游戏世界探索,但它们从根本上仍然脱离了以人类为中心的社会动态。为了弥补这一差距,作为社交世界模型的第一步,我们推出了 MaineCoon,这是第一个实时视听自回归模型,它具有 22B 参数,能够实时流生成和亚秒级交互,在单个 GPU 上具有高达 47.5 FPS 的破纪录帧率。据我们所知,MaineCoon 也是第一个专门针对社交互动应用程序优化的实时视听生成模型。为了实现高效稳定的训练,我们在 MaineCoon 中引入了多种新技术,包括自重采样、跨模式表示对齐、领域感知偏好优化和强化在线策略 蒸馏 (ROPD)。我们还设计了第一个代理流推理框架,该框架支持千秒规模甚至更长的生成,同时通过代理缓存管理和提示规划来减轻漂移。这些创新显着加快了训练速度,同时优化了实时推理性能。我们相信这项工作不仅为高质量、低延迟、长视野的视听自回归模型设定了新的最先进(SOTA)性能基准,而且还指出了下一代人工智能原生社交平台所需的范式转变。