论文

LPM 1.0:基于视频的角色表演模型

LPM 1.0: Video-based Character Performance Model

应用与实践内容创作

摘要

表演,即意图、情感和个性通过视觉、声音和时间行为的外化,是使角色栩栩如生的要素。从视频中学习这种性能是传统 3D 管道的一种有前途的替代方案。然而,现有的视频模型很难同时实现高表达性、实时推理和长期身份稳定性,我们将这种张力称为性能三难困境。对话是最全面的表演场景,因为角色会同时说话、倾听、做出反应和表达情感,同时随着时间的推移保持身份。为了解决这个问题,我们提出了 LPM 1.0(大型性能模型),重点关注单人全双工视听会话性能。具体来说,我们通过严格的过滤、说听音视频配对、性能理解和身份感知多参考提取,构建了一个以人为中心的多模态数据集;训练 17B 参数 Diffusion Transformer(基础 LPM),通过多模式调节实现高度可控、身份一致的性能;并将其提炼到因果流生成器(Online LPM)中,以实现低延迟、无限长度的交互。由此推断,给定具有身份感知参考的角色图像,LPM 1.0 会根据用户音频生成聆听视频,并根据合成音频生成说话视频,并带有用于运动控制的文本提示,所有这些都以实时速度进行,并具有身份稳定、无限长度的生成。因此,LPM 1.0 可以作为对话代理、直播角色和游戏 NPC 的视觉引擎。为了系统地评估此设置,我们提出了 LPM-Bench,这是交互式角色性能的第一个基准。 LPM 1.0 在所有评估维度上实现了最先进的结果,同时保持实时推理。