技术实践

淘天以3DGS和动捕构建真人数字人

应用与实践模型优化AI 基础设施端侧模型模型部署内容创作行业应用语音交互与综合语音服务视觉感知与空间理解

概述

Meta技术团队 2025 年推出 3D 真人数字人 TaoAvatar 并在 XR 眼镜端完成体验,2026 年扩展到多服饰/多动作一体化建模:以 SMPLX++(发服饰非刚性形变)、SMPLX-Ace(自动骨骼绑定)、Retargeting 构建动捕链路,脸部用 EMOCA、手部用 HaMeR、身体用 SAM-3DBody 分层监督,平均 PVE 误差 6-7mm、优于开源 SOTA EasyMocap;单 ID 多服饰多动作一体化建模后资产约 400MB、端侧 90FPS 实时推理渲染;TaoVideo 4DGS 用样条曲线描述高斯运动与外观,20-25 秒素材端侧约 90FPS、FP16 单段约 400MB、PSNR 31-35、LPIPS 0.06-0.1。整体指标:清晰度 PSNR>35、实时驱动与渲染 90FPS、双目 2K、多模态交互首字延迟<2 秒、内存占用<2.5GB,制作成本低于 2 万元、交付效率低于 1 周。 TaoAvatar 的语音与文本驱动手势框架:系统接收语音和文本后生成两类动作,基础手势由 GestureDiT 结合语音与文本特征对 SMPLX 人体结构分层建模(先生成上半身、再预测手指姿态、下半身条件化生成);强语义手势则用 Qwen-LLM 理解文本内容、检索匹配的预制语义动作,并注入 GestureDiT 的去噪过程。训练使用单目视频动捕数据与 3D 影棚多模态数据,推理一次预测 1 秒动作、RTF 小于 1,可在 3090 消费级显卡部署,中英文均能生成对应手势。