论文

超越转录:使用音频进行迭代同行编辑解锁对话语音的高质量人工摘要

Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech

模型评测基准与评测资源

摘要

对于语音摘要任务没有足够的既定基准。创建新的基准需要人工注释,因为 LLM 可能会将系统错误和偏见嵌入到数据集中。我们测试了十种注释工作流程,不同的输入方式(音频、转录或两者)以及编辑(自我或同行编辑)的内容,以调查使用人类注释者总结音频的潜在质量权衡。我们将基于人类音频的摘要与基于人类转录的摘要进行比较,以跟踪不同信息模式对摘要质量的影响。我们还将人类输出与四个 LLM 基准(三个文本,一个音频)进行比较,以检查人类编写的摘要是否比高度流畅的自动化输出信息量少。我们发现基于音频的摘要比文字摘要信息量较少且压缩程度更高。然而,使用音频进行迭代同行编辑可以缓解这种差异,使基于音频的摘要能够与转录副本和 LLM 摘要一样提供丰富的信息。这些发现验证了人类注释者之间的迭代同行编辑,以创建由词汇和韵律信息提供的基准。即使在转录本不可用的情况下,这也可以实现关键的数据集收集。