模型MiniMax H3:统一理解多模态的音视频联合生成模型MiniMax 发布 H3MiniMax·来源日期:2026.07.30应用与实践内容创作收藏概述MiniMax 发布通用多模态生成模型 H3。模型统一理解由文本、图像、视频和音频构成的上下文,可执行文本生成音视频、图像生成音视频、首尾帧生成音视频以及参考与编辑等任务;生成视频最长 15 秒、最高 2K 分辨率,并带原生立体声。发布时已在海螺 AI 提供可验证体验,用户可在产品中检验各项能力的真实水平。