论文

评估个人健康记录在个性化健康AI中的效用

Evaluating the Utility of Personal Health Records in Personalized Health AI

模型评测模型能力评测

摘要

由患者管理的个人健康记录(PHR)有望帮助患者更好地了解自身健康;但记录中的信息复杂,可能妨碍洞见的获得。在本研究中,我们评估大语言模型(LLM,Gemini 3.0 Flash)在以PHR临床数据作为上下文时,为用户健康问题提供有用回答的潜力。共2,257条用户查询取自3种不同分布以代表患者问题:较短的网页搜索查询、由聊天机器人对话模板衍生的较长问题,以及患者向其医疗团队提出的问题(患者来电)。查询与去标识化的PHR(来自1,945份的池)相匹配。Gemini的回答在三种条件下生成:(1) 无PHR上下文;(2) 提供人口学特征、病症与用药的基础摘要;(3) 提供完整、详尽的临床记录。在评估方面,我们利用了现有评分框架(SHARP),并针对解读PHR时的特定错误模式开发了新框架。评估对全部数据使用自动评分器,对子集(n=95)使用临床医生评分,两组评分者均知悉完整PHR上下文。我们发现,加入PHR数据后,所有问题类型回答的有用性都显著提升(p < 0.001,配对t检验)。我们还观察到回答在安全性、准确性、相关性与个性化方面的潜在提升。我们的PHR评估框架还识别出LLM理解复杂PHR特定方面时的缺口,例如时间上的迷失,以及罕见但有意义的虚构。这些结果表明PHR数据有望帮助具有广泛用户需求的人群,并提供了监测基于PHR上下文的LLM回答缺口的框架。本研究激发了进一步的工作,以评估并实现用户从理解自身健康记录中获得的潜在收益。

评估个人健康记录在个性化健康AI中的效用
图 1:研究概述。我们对在响应语言模型查询时包含个人健康记录数据的效用进行了评估。 A) 我们从网络搜索、聊天机器人对话和患者呼叫中抽取了 2,257 个用户查询样本。 B) 我们根据与该 PHR 相关的查询的合理性将这些与去识别化的 PHR 配对。 C) 为查询和 PHR 对生成语言模型响应。 D) 临床医生和自动评估者对两个一般轴(SHARP;参见方法)和 PHR 特定轴的评分。 E) 自动评分器对所有问题和基于问题来源的 3 个子集的有用性结果。 F) 与 E 相同,但针对由临床医生评估的子集,自动评分器结果在左侧,临床医生评分在右侧。值表示 [-1, 1] 范围内的平均得分,加上 95% 自举置信区间。黑色:无 PHR 答案,红色:基本 PHR 答案,蓝色:完整 PHR 答案。