开源项目
PL-Flow 新仓库公开两阶段参考条件语音合成流程
rcell233/pl-flow
概述
PL-Flow 是参考条件文本转语音项目,使用短参考录音及准确转写,输出32kHz单声道音频。仓库提供 CLI 和 Python Synthesizer、S1韵律与S2声学/时长流程、对齐和模型 bundle 加载,以及 Seed-TTS-Eval 测试入口;中、英、日训练语料与冻结预训练特征编码器在 README 中说明。作者报告生成网络约215.6M参数,但此口径不包含独立 codec 和参考特征编码器,采样设置也曾在部分测试子集选择,不能直接据表格宣布普遍最优。依赖 Python3.10、PyTorch/TorchAudio,权重与说话人特征资源需另行下载,支持 CPU 路径。应用许可 GPL-3.0-only,组件许可见 THIRD_PARTY。