论文

长猫-视频-阿凡达1.5技术报告

LongCat-Video-Avatar 1.5 Technical Report

应用与实践内容创作

摘要

尽管音频驱动的视频生成取得了进步,但实现商业级稳定性仍然具有挑战性。我们推出了 LongCat-Video-Avatar 1.5,这是一个升级的开源框架,优先考虑系统工程和生产就绪性,而不是架构新颖性。通过将音频编码器升级到 Whisper Large 并精心扩展我们的训练方案,v1.5 实现了精确的口型同步、全身时间稳定性以及具有严格身份一致性的强大长视频生成。通过严格的数据管理和 RLHF 训练,该模型很容易推广到动漫和动物等风格化领域,并原生处理复杂的现实世界条件,例如多人交互和对象处理。此外,为了满足工业部署的实际需求,我们采用先进的步骤蒸馏来加速推理到最佳8 NFE,在服务效率和视觉保真度之间实现有利的权衡。我们的方法的优越性通过广泛的定量指标和对 500 多个不同测试用例的综合基准进行的严格的人工评估得到了验证。结果表明,与领先的闭源系统(例如 HeyGen、OmniHuman 1.5、Kling Avatar 2.0)相比,v1.5 在我们的基准的人类相似度评级和专家级质量评估方面实现了具有竞争力或优越的性能。随着LongCat-Video-Avatar 1.5的开源发布,缩小了学术研究原型和商业级部署之间的差距。