模型

MOVA同步视听生成模型发布开放

MOVA同步视频音频模型发布

模型架构混合架构

概述

OpenMOSS发布MOVA同步视频与音频生成基础模型,采用非对称双塔架构,通过双向交叉注意力融合预训练的视频塔和音频塔,单次推理即可生成音画同步的视听内容。1月29日宣布开放模型,提供权重、推理代码、训练管线及LoRA微调脚本,仓库采用Apache-2.0许可。开发者可自行部署生成,也能用LoRA脚本在自有数据上微调,训练管线的开放让整套方法具备可复现性。