论文

Prosody-to-Text:根据低通滤波语音预测文本

Prosody-to-Text: Predicting text from low-pass filtered speech

模型评测模型能力评测

摘要

虽然从文本预测韵律是该领域的一项既定任务,但相反的方向,即预测适合给定韵律模式的文本,仍然在很大程度上被忽视。我们发现这很不幸,因为这个相反的方向可能会导致一些非常有趣的用例。因此,在本文中,我们通过研究可以从韵律模式中恢复多少原始句子,在韵律到文本的方向上迈出了第一步。为此,我们仅使用 12 个最低的 Mel bin(截止频率约为 450Hz 的低通滤波器)对 Whisper 模型进行微调,并获得了令人惊讶的准确结果(WER 36%),其中 10% 的话语得到完美恢复,40% 的话语的词错误率等于或低于 25%。我们还发现,如果给出正确的前缀,则在 79% 的情况下可以正确预测下一个标记。我们的结果表明,低频语音特征和词汇内容之间的关系比以前想象的要强得多,我们相信,更多地关注这个主题可能会打开新的大门。 应用程序,例如使用韵律来指导现代LLM的文本生成