论文

Pixel-TTS:基于图像的文本渲染,实现强大的文本转语音

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech

应用与实践内容创作

摘要

基于像素的文本建模的最新进展表明,将文本表示为图像使模型能够利用视觉线索来理解语言。将文本以其视觉形式为基础,允许具有不同 Unicode 编码的结构相似的字符产生相似的嵌入,从而有利于跨语言和零样本场景。传统的基于文本的方法独立地处理每个字符,限制了对未见过字符的泛化,并且需要在跨语言适应期间进行嵌入扩展。我们提出 Pixel-TTS,一种用于基于视觉的语音合成的文本到语音框架。它将文本渲染为图像,并通过 2D 卷积层将其投影以生成嵌入。此设计消除了 微调 期间的嵌入矩阵扩展,同时提高了对看不见的字符和拼写变化的鲁棒性。大量实验表明 Pixel-TTS 凭借强大的基线、更快的收敛速度和强大的零样本泛化能力实现了具有竞争力的性能。