论文
面向口语处理任务的机器人-患者与医生-患者医疗对话数据集
A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing Tasks
摘要
大语言模型(LLM)给人工智能(AI)带来了巨大进步,可应用于通用任务。然而,将其应用于文本或口语医疗问诊仍是一个开放的研究问题。本文提出MeDial-Speech,一个新颖的语音数据集,用于训练和评估能够与患者进行问诊的Med-AI(医疗AI)。该数据集在真实环境中从机器人-患者与医生-患者对话中采集,包含111小时以上的语音数据(未做数据增强),覆盖四种健康状况:路易体痴呆、心力衰竭、肩痛和心绞痛。此外,我们提出一个通过句子选择(含20个选项)构成的对话基准,用于评估三个最先进的LLM:GPT-5 mini、DeepSeek-V3和Claude Sonnet 4。实验结果显示,Claude Sonnet 4在句子选择上表现最佳,使用人工转写时准确率为71.1%,使用自动转写时为74.7%;而且无论在医疗对话中选对还是选错句子,所有LLM的概率预测都高度过度自信。该数据集可供非商业用途免费获取:https://huggingface.co/datasets/hcuayahu/MeDial-Speech
