模型

MiniMax H3:统一理解多模态的音视频联合生成模型

MiniMax 发布 H3

应用与实践内容创作

概述

MiniMax 发布通用多模态生成模型 H3。模型统一理解由文本、图像、视频和音频构成的上下文,可执行文本生成音视频、图像生成音视频、首尾帧生成音视频以及参考与编辑等任务;生成视频最长 15 秒、最高 2K 分辨率,并带原生立体声。发布时已在海螺 AI 提供可验证体验,用户可在产品中检验各项能力的真实水平。