论文
维基百科口语演示语料库
The Spoken Wikipedia Presentation Corpus
摘要
我们展示了维基百科口语演示语料库,这是维基百科口语语料库的扩展,具有大语言模型生成的用于多模式 ASR 的幻灯片。幻灯片是使用混合管道从 LLM 分段部分创建的,该管道将基于 LLM 的内容规划与基于规则的设计决策相结合。对于每个部分,大语言模型都会生成幻灯片标题、要点、要点和用于创建插图的视觉描述。然后,基于规则的匹配会选择布局、主题和样式来生成最终的幻灯片。愿景大语言模型将幻灯片文本提取为 Markdown。我们评估多种 ASR 和口语模型 (SLM)。最佳模型在纯音频输入上的平均微 WER 为 10.23%,平均微 CER 为 6.48%。英语的错误率最低,其次是德语和荷兰语,而资源较低的语言的性能会下降。尽管纯音频基线很强大,但全向模型的多模式零样本提示仍然具有挑战性。对齐的幻灯片、文本和音频数据显示出通过跨模式上下文提高识别的强大潜力。