论文
LifeAgentBench:数字健康个人健康助手的多维基准和代理
LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health
摘要
个性化数字健康支持需要对异构生活方式信号进行长期、跨维度的推理,而移动传感和大语言模型 (LLM) 的最新进展使这种支持变得越来越可行。然而,由于缺乏系统的基准,目前大语言模型在这方面的能力仍不清楚。在本文中,我们介绍了 LifeAgentBench,这是一个用于长视野、跨维度和多用户生活方式健康推理的大规模 QA 基准,包含从基本检索到复杂推理的 22,573 个问题。我们发布了可扩展的基准构建管道和标准化评估协议,以便对基于大语言模型的健康助理进行可靠且可扩展的评估。然后,我们在 LifeAgentBench 上系统地评估 11 个领先的大语言模型,并确定长视野聚合和跨维度推理中的关键瓶颈。受这些发现的启发,我们建议 LifeAgent 作为健康助理的强大基线代理,它将多步骤证据检索与确定性聚合相结合,与两种广泛使用的基线相比取得了显着的改进。案例研究进一步证明了其在现实日常生活场景中的潜力。该基准可在 https://anonymous.4open.science/r/LifeAgentBench-CE7B 上公开获取。
