论文
迈向有眼、有耳、有声音的会话医疗AI
Towards Conversational Medical AI with Eyes, Ears and a Voice
摘要
医学实践不仅依赖于熟练的对话,还依赖于医生和患者之间丰富的听觉和视觉线索的细致入微的交流和解释。基于 Gemini 的低延迟语音和视频处理能力,我们推出了 AI co-clinician,这是一款首创的对话式 AI 系统,利用来自实时患者对话的连续视听数据流来为实时临床决策提供信息。其双代理架构平衡了深度临床推理与自然对话所需的低延迟。为了评估该系统,我们实现了一个模拟远程医疗咨询的基于视频的界面。我们精心设计了 20 个需要主动实时听觉和视觉推理的标准化门诊场景,并设计了“TelePACES”评估标准以及具体案例的评估标准。在一项以 10 名内科住院医师为患者参与者的随机、界面盲法交叉模拟研究(n = 120 次遭遇)中,我们将 AI 联合临床医生与初级保健医生 (PCP)、GPT-Realtime 和基线代理进行了比较。 AI 联合临床医生在 TelePACES 的关键维度(包括管理计划和鉴别诊断)与 PCP 进行了接触,同时在所有一般标准上均显着优于 GPT-Realtime。虽然我们的代理人在针对特定病例的分诊措施中表现出与 PCP 相当的表现,但医生在针对特定病例的评估中仍保持着优异的整体表现。尽管人工智能联合临床医生标志着实时远程医疗人工智能的重大进步,但在体检和特定疾病推理方面仍然存在差距。我们的工作表明,纯文本方法无法捕捉医疗咨询的真正挑战,并表明高风险的实时诊断人工智能在协作、三元模型中最安全地推进,在这种模型中,人工智能可以成为医生和患者的支持性联合临床医生。
