论文
DocTalkBN:孟加拉语专家远程医疗对话的新颖数据集
DocTalkBN: A Novel Dataset of Expert Telemedicine Conversations in Bengali
摘要
可靠的医疗对话人工智能需要真实的专家与患者交互数据,但此类数据集仍然稀缺,特别是对于孟加拉语等资源匮乏的语言。我们展示了 DocTalkBN,这是一个孟加拉语真实世界专家远程医疗对话的大型多模式数据集,收集自全国广播的远程医疗节目,其中包括经过委员会认证的医生。 DocTalkBN 包含 557.63 小时的配对音频和文本、1,515 次多轮患者呼叫、10,274 次主持人-医生问答交换,总计 170 万个词元,涵盖 26 个医学专业。与之前源自医学论坛、书面健康内容或合成数据的资源不同,我们的数据集保留了资源匮乏环境下真实医疗互动的自发性、上下文丰富性和口语特征。为了支持基准驱动的研究,我们进一步从语料库、医疗分诊分类、建议安全评估和医疗命名实体识别构建三个下游任务,并对一组不同的 大语言模型 和基于编码器的基线进行基准测试。我们的结果表明,DocTalkBN 是一种实用的资源,特别是对于临床推理任务。我们发布此资源是为了促进未来对可靠的医学 NLP 以及针对资源匮乏语言的更安全、更具有文化基础的医疗保健系统的研究。我们的源代码和数据集可在 https://anonymous.4open.science/r/doctalk 上公开获取。