论文

迈向有眼、有耳、有声音的会话医疗AI

Towards Conversational Medical AI with Eyes, Ears and a Voice

智能体系统Agent 架构与控制循环

摘要

医学实践不仅依赖于熟练的对话,还依赖于医生和患者之间丰富的听觉和视觉线索的细致入微的交流和解释。基于 Gemini 的低延迟语音和视频处理能力,我们推出了 AI co-clinician,这是一款首创的对话式 AI 系统,利用来自实时患者对话的连续视听数据流来为实时临床决策提供信息。其双代理架构平衡了深度临床推理与自然对话所需的低延迟。为了评估该系统,我们实现了一个模拟远程医疗咨询的基于视频的界面。我们精心设计了 20 个需要主动实时听觉和视觉推理的标准化门诊场景,并设计了“TelePACES”评估标准以及具体案例的评估标准。在一项以 10 名内科住院医师为患者参与者的随机、界面盲法交叉模拟研究(n = 120 次遭遇)中,我们将 AI 联合临床医生与初级保健医生 (PCP)、GPT-Realtime 和基线代理进行了比较。 AI 联合临床医生在 TelePACES 的关键维度(包括管理计划和鉴别诊断)与 PCP 进行了接触,同时在所有一般标准上均显着优于 GPT-Realtime。虽然我们的代理人在针对特定病例的分诊措施中表现出与 PCP 相当的表现,但医生在针对特定病例的评估中仍保持着优异的整体表现。尽管人工智能联合临床医生标志着实时远程医疗人工智能的重大进步,但在体检和特定疾病推理方面仍然存在差距。我们的工作表明,纯文本方法无法捕捉医疗咨询的真正挑战,并表明高风险的实时诊断人工智能在协作、三元模型中最安全地推进,在这种模型中,人工智能可以成为医生和患者的支持性联合临床医生。

迈向有眼、有耳、有声音的会话医疗AI:论文配图
图 1:主要贡献概述。 A. 实时远程医疗界面,患者参与者通过连续的音频视频流与人工智能代理或医生进行交互。 B. 交叉比较研究:AI 联合临床医生(我们的音视频医疗代理)的表现与 3 个比较者(包括 3 位初级保健医生 (PCP) 和 GPT-Realtime)在 20 个标准化临床场景(界面盲态患者参与者)上进行了评估。绩效评估需要将 7 个领域的具体病例评分标准与通用评分标准相结合,从而能够在病史采集、体格检查、临床推理、沟通、治疗、分诊和危险信号检测方面进行头对头比较。