论文

SymptomAI:用于日常症状评估的对话式人工智能代理

SymptomAI: Towards a Conversational AI Agent for Everyday Symptom Assessment

智能体系统Agent任务评测

摘要

语言模型擅长对精心策划的医疗案例研究和小插图进行诊断评估,其表现与临床专业人员相当或更好。然而,现有的研究侧重于具有丰富背景的复杂场景,因此很难就这些系统对日常生活中报告症状的患者的表现得出结论。我们在一项研究中通过 Fitbit 应用程序部署了 SymptomAI,这是一组用于端到端患者访谈和鉴别诊断 (DDx) 的对话式 AI 代理,该研究随机分配了参与者 (N=13,917) 与 5 个 AI 代理进行交互。该语料库捕捉了现实世界人口的多样化交流和疾病的真实分布。 1,228 名参与者的子集报告了临床医生提供的诊断,其中 517 名参与者由临床医生小组在超过 250 小时的注释过程中进行了进一步评估。在盲法随机比较中,与独立临床医生提供的相同对话相比,SymptomAI DDx 的准确率明显更高(OR = 2.56,p < 0.001)。此外,在提供诊断之前进行专门的症状访谈以引出额外症状信息的代理策略的表现明显优于基线、用户引导的对话(p < 0.001)。对美国普通人口小组的 1,509 次对话进行的辅助分析证实,这些结果适用于可穿戴设备用户。我们使用 SymptomAI 诊断作为所有 13,917 名参与者的标签,分析近 400 种独特条件下超过 500,000 天的可穿戴指标。我们发现急性感染和生理变化之间存在很强的关联(例如,流感的 OR > 7)。虽然受到自我报告的基本事实的限制,但这些结果证明了与用户引导的症状讨论相比,专门且完整的症状访谈的好处,这是大多数消费者LLM的默认设置。

SymptomAI:用于日常症状评估的对话式人工智能代理
图 1:SymptomAI 研究。 (a-b) SymptomAI 的实验性部署研究程序,用于端到端患者访谈和用于症状评估的生成式 AI 鉴别诊断 (DDx),以研究参与者报告的从医疗保健提供者 (HCP) 收到的诊断为基准。 (c-d) 这产生了外行人与最近的可穿戴数据配对的自然症状对话的大型数据集 (N=13,917)。 (e) 我们利用临床专家注释来验证 SymptomAI DDx,并为 LLM 验证器(即自动评估器)的开发提供信息,以将验证范围扩大到临床评估子样本之外。 (f) 利用 SymptomAI 作为表型标记器,可以对研究人群的生物信号进行全表组分析。