论文

HealthLoopQA:用于解释糖尿病护理中可穿戴监测数据的上下文感知问答基准

HealthLoopQA: A Context-Aware Question Answering Benchmark for Interpreting Wearable Monitoring Data in Diabetes Care

模型评测基准与评测资源

摘要

随着医疗可穿戴设备融入日常慢性病护理中,有效解释纵向监测数据对于患者和临床医生了解健康趋势、检测安全关键事件并做出明智决策至关重要。虽然 大语言模型 (LLM) 有望将这种流式生理数据转化为个性化的健康见解,但评估其在各种监测任务中的推理能力和分析严谨性仍然是一个基本挑战。现有的医疗可穿戴问答(QA)基准主要评估短期分类或统计摘要,很大程度上忽略了长期模式、治疗和行为背景以及现实世界部署中固有的潜在系统故障。为了解决这个问题,我们引入了 HealthLoopQA,这是一个综合诊断基准,用于评估 LLM 对连续糖尿病监测数据的推理。 HealthLoopQA 基于 11 种原子推理能力的新颖分类法,包含 127 项任务和 1,500 多个 QA 实例,涵盖 30 天范围内的流程挖掘、异常检测和预测。为了系统地评估安全意识,我们通过故障注入模拟测试台来补充现实世界的数据集,该测试台对各种设备故障和网络物理攻击进行建模,以生成生理上合理的危险场景。跨提示和代理框架评估最先进的 LLM 揭示了复杂时间模式挖掘的严重局限性。此外,我们在长上下文提示下发现了更广泛的上下文懒惰现象,强调了部署 LLM 进行严格的长期医学推理的关键开放挑战。