论文
评估个人健康记录在个性化健康AI中的效用
Evaluating the Utility of Personal Health Records in Personalized Health AI
摘要
由患者管理的个人健康记录(PHR)有望帮助患者更好地了解自身健康;但记录中的信息复杂,可能妨碍洞见的获得。在本研究中,我们评估大语言模型(LLM,Gemini 3.0 Flash)在以PHR临床数据作为上下文时,为用户健康问题提供有用回答的潜力。共2,257条用户查询取自3种不同分布以代表患者问题:较短的网页搜索查询、由聊天机器人对话模板衍生的较长问题,以及患者向其医疗团队提出的问题(患者来电)。查询与去标识化的PHR(来自1,945份的池)相匹配。Gemini的回答在三种条件下生成:(1) 无PHR上下文;(2) 提供人口学特征、病症与用药的基础摘要;(3) 提供完整、详尽的临床记录。在评估方面,我们利用了现有评分框架(SHARP),并针对解读PHR时的特定错误模式开发了新框架。评估对全部数据使用自动评分器,对子集(n=95)使用临床医生评分,两组评分者均知悉完整PHR上下文。我们发现,加入PHR数据后,所有问题类型回答的有用性都显著提升(p < 0.001,配对t检验)。我们还观察到回答在安全性、准确性、相关性与个性化方面的潜在提升。我们的PHR评估框架还识别出LLM理解复杂PHR特定方面时的缺口,例如时间上的迷失,以及罕见但有意义的虚构。这些结果表明PHR数据有望帮助具有广泛用户需求的人群,并提供了监测基于PHR上下文的LLM回答缺口的框架。本研究激发了进一步的工作,以评估并实现用户从理解自身健康记录中获得的潜在收益。
