论文
从文档改进播客忠实性
On Improving Faithfulness of Podcasts from Documents
摘要
大语言模型 (LLM) 越来越多地用于生成长格式会话内容,例如来自文本源的播客。虽然这些系统可以产生流畅且引人入胜的叙述,但它们经常引入不可靠的信息。在这项工作中,我们提出了 忠实性 在基于文档的播客生成中的首次系统研究,其中必须在长格式、多说话人的转录中的对话轮流中保持基础。我们构建了一个包含跨越 5 个域的 1500 多个文档的数据集,并使用多个 LLM 生成播客转录本。我们引入了一个回合级 LLM-as-a-judge 框架,用于评估源文档是否支持对话回合,并通过人类研究验证其可靠性。我们的分析表明,即使是最先进的模型,包括 GPT-4o,也经常生成不可靠的内容。为了缓解这个问题,我们提出了 catch-n-repair,这是一种与模型无关的框架,可以检测并重写不忠实的对话轮次,同时保留对话流。实验证明 忠实性 在域内和域外设置上都有一致的改进。