论文
BALMS:纵向心理健康传感的基准测试代理 LLM
BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing
摘要
心理健康评估依赖于情景自我报告量表,它将压力等主观状态转化为数字分数,但仅提供稀疏的幸福感快照。可穿戴设备提供纵向行为和生理信号,用于连续、低负担的监测。最近的 LLM 驱动的个人健康代理可以通过可穿戴信号进行自然语言查询,但主要处理短期的、基于检索的查找(例如,一周内的最高步数)。他们没有评估智能体是否可以根据长期信号进行推理,以预测与基于证据的基本原理相结合的健康分数。为了解决这一差距,我们引入了 BALMS,这是基于 LLM 的代理系统的第一个系统基准,用于纵向心理健康感知。 BALMS 涵盖 3 个真实世界的纵向数据集、2 个任务系列(由 LLM 作为法官自动评分的封闭式幸福评分预测和基本原理生成)、跨 5 个开源和闭源 LLM 主干评估的 3 个代理范式。我们发现,零样本代理很少能超越简单的平均基线,除非具有更强的骨干网或紧凑的、语义上有意义的特征。思维链提示可以改善以推理为导向的主干,但不能保证时间基础或数字正确性。结合对效率和时间尺度的更多分析,BALMS 强调了对纵向心理健康代理的需求,这些代理可以选择性地检索历史、地面时间证据,并对可解释的行为特征进行推理。