模型
微软发布MAI-Voice-2.1及Flash,同一音色支持23种语言
MAI-Voice-2.1 and MAI-Voice-2.1-Flash
概述
微软同日推出MAI-Voice-2.1和MAI-Voice-2.1-Flash文本转语音家族,支持23种语言、26个地区变体,同一音色在切换语言时保持说话人特征。Flash面向高容量、低延迟负载,官方称可在150ms端到端模型生成延迟内生成45秒音频;这是厂商模型测量,不能包含网络、排队和上游推理。两个版本支持短参考音频克隆,并设置同意防护。原文列价为每百万字符22/15美元,提供Foundry、Playground和相关平台入口,LiveKit仍待后续开放。两种变体合并一条,与语音转写模型按不同任务分别记录。