论文
生成合成的医患对话以进行长格式音频摘要
Generating Synthetic Doctor-Patient Conversations for Long-form Audio Summarization
摘要
长上下文音频推理在训练数据和评估方面都没有得到充分利用。现有的基准测试针对的是短上下文任务,而与长上下文推理最相关的开放式生成任务对自动评估提出了众所周知的挑战。我们提出了一个综合数据生成管道,旨在充当训练资源和受控评估环境,并将其实例化以用于首次就诊的医患对话,并以 SOAP 注释生成为任务。该管道具有三个阶段:角色驱动的对话生成、具有重叠/暂停建模的多说话人音频合成、室内声学和声音事件,以及完全基于开放权重模型构建的基于 LLM 的参考 SOAP 笔记生成。我们发布了 8,800 条综合对话以及 1,300 小时的相应音频和参考笔记。评估当前的开放权重系统,我们发现级联方法仍然大大优于端到端模型。