论文

WearableQA:基于现实世界可穿戴数据的健康推理基准

WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

模型评测基准与评测资源

摘要

可穿戴传感领域的最新进展使得能够连续监测生理和行为信号,但现有的基准很少评估人工智能系统是否可以对真实用户的纵向可穿戴记录进行推理。我们推出了 WearableQA,这是一个包含 4,084 个 10 选项多项选择问题的基准测试,这些问题由可穿戴时间序列、血液生物标记物和 200 名真实用户的人口统计数据构成,每个问题都有长达 500 天的每日测量结果。 WearableQA 保留真实的可穿戴分布,包括设备噪声和个体间差异。为了评估不同的推理能力,我们引入了沿着两个互补轴组织的 16 种问题类型:数据与健康推理,它将纵向测量的计算与生理解释区分开来;单信号推理与跨信号推理,它将单个信号的推理与多个信号的集成分开。为了大规模构建可靠的问题,我们采用了双重基础框架,该框架将基于文献的生理发现与经过统计验证的基于人群的生理模式相结合。这使得能够捕获在现实世界的可穿戴数据中观察到的有意义的关系。对 14 个专有和开源 LLM 的评估表明,WearableQA 有效区分了模型功能,相对于 10% 机会基准,性能范围为 19.6% 到 72.9%。此外,WearableQA 问题还远没有得到解决:大多数模型的准确率都低于 60%。总体而言,WearableQA 提供了一个现实的诊断基准,用于评估 LLM 对现实世界可穿戴数据的推理。