论文
VoxSumm:用于联合摘要和翻译的长篇口语新闻多语言语料库
VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation
摘要
随着信息越来越多地跨越语言边界,用户需要长格式内容的简洁的跨语言表示。尽管如此,长文档摘要研究仍然以文本为中心,而多语言语音研究在很大程度上优先考虑翻译,保留源内容而不是压缩它。我们通过形式化联合语音摘要和翻译(JSumT)来解决这一方法论差距:直接从源语言的长口语文档生成简洁、忠实的目标语言摘要。我们还引入了 VoxSumm,这是该任务的第一个多语言和跨语言基准,包含 24 种语言的 10,045 个 BBC 文章摘要对,包含大约 703 小时的语音数据。我们对代表性语音语言模型的评估揭示了模型和生成设置之间的显着差异:Gemini3.1-Pro 表现出最大的一致性,英语摘要通常超过非英语目标语言的生成,并且在摘要之前翻译整个文档会导致指令跟踪失败。通过 VoxSumm 的发布,我们为开发和评估能够联合解释、压缩和翻译长篇语音的多语言系统奠定了基础。