论文

ESPnet3:基础模型时代可扩展语音和音频研究的基础设施

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

AI 基础设施数据基础设施

摘要

最近的语音研究涉及越来越大的数据集、复杂的模型和多样化的实验工作流程。然而,现有框架需要大量的工程工作来支持此类实验。我们推出了 ESPnet3,这是一个基于模块化系统架构构建的语音和音频研究框架,具有配置驱动的数据集组成和基于 Python 的统一工作流程。 ESPnet3 引入了 DataOrganizer 抽象,用于灵活的数据集集成和数据集分片,以实现内存高效的大规模训练,同时通过轻量级覆盖允许特定于配方的逻辑。在 OWSM 预训练 实验中,与 ESPnet2 相比,ESPnet3 将每轮训练时间减少了 \emph{21.1 分钟},并在多节点训练中实现了 \emph{>80\% GPU 利用率}。 微调 实验表明,新模型和数据集可以与大约 \emph{46 行附加代码}集成。 ESPnet3 将公开发布模型检查点和训练日志。