模型

LongCat-Video-Avatar 1.5 正式开源:唇形同步、物理合理性与长视频稳定性

从高拟真到真可用,LongCat-Video-Avatar 1.5 正式开源

应用与实践模型推理模型优化推理加速蒸馏内容创作

概述

LongCat-Video-Avatar 1.5 定位为从开源 SOTA 迈向商业级应用的数字人视频模型,本次三方面升级:一是基础体验商用化,长句、快语速、歌唱等复杂语音输入下唇部运动更精准平滑,面部表情、头部姿态与肢体动作协同更自然稳定;音频特征提取编码器由 Wav2Vec2 升级为 Whisper-large,以更大参数量与多语言先验捕捉音素变化、发音节奏与多语言韵律,同时提升唇形同步与全身时序稳定性,减少长视频中的抖动、跳帧、画面冻结与身份漂移。二是场景泛化,构建多阶段数据流程(离线标注提取人脸关键点、人物数量、身体构图、音画同步;在线验证过滤转场、黑帧、闪烁、跳帧),并专门构建多人数据(主动说话人检测,保留单一说话人发声片段)、静默数据(学习无语音状态下微表情与身体动态)、情绪数据(多模态初筛+帧级情绪识别精筛)三类增强数据,可稳定处理真人、动漫、动物等多类主体。三是动作质量,引入 GRPO 进行人类偏好对齐并把奖励细化到逐帧,修正动作不连贯、手部变形、短时结构崩塌与表情-语音不匹配,针对图像到视频与视频续写加入首帧手部检测并提高含可见手部样本训练比例。评测基于自建 EvalTalker 基准(覆盖新闻、教育、娱乐、商业场景,按语速/情绪、人数/姿态/遮挡设难度,770 名评估者完成 13,240 条主观评分,10 名领域专家做结构化质量分析):用户偏好相比 Kling Avatar 2.0 胜率 65.9%、OmniHuman-1.5 胜率 61.1%、HeyGen 胜率 54.3%;单人场景得分 3.336,多人场景 2.730(InfiniteTalk 2.339);主体变形问题率 23.1%、背景变形 9.4%、跳帧问题率 0.8%(对比模型中最低)、面部-身体同步问题率 5.1%、唇形同步问题率 29.8%,均低于对比模型。