论文

TimeSRL:通过语义 RL 调整的可推广时间序列行为建模 LLM——心理健康案例研究

TimeSRL: Generalizable Time-Series Behavioral Modeling via Semantic RL-Tuned LLMs -- A Case Study in Mental Health

模型推理推理策略与问题分解

摘要

纵向被动传感可以实现连续的健康预测,但模型经常在跨数据集分布变化的情况下失败。传统的 ML 会过度拟合特定于队列的工件,而 大语言模型 (LLM) 则很难在长时间、异构的时间序列上进行可靠的推理。我们引入了 TimeSRL,这是一个两阶段的 LLM 框架,可通过显式语义瓶颈路由预测。该模型首先将原始信号抽象为高级自然语言,然后仅根据这些抽象来预测行为结果。这迫使模型对语义概念进行推理,我们认为这些概念比原始数字更好地概括。我们使用组相对策略优化(GRPO)和可验证奖励强化学习(RLVR)来端到端优化这个过程,学习结果一致的抽象,无需黄金中间注释。以心理健康预测为例,TimeSRL 在严格的留一数据集 (LOSO) 协议下对跨队列泛化进行压力测试的基准上实现了最先进的性能,与强非 LLM ML 和 LLM 基线相比,平均绝对误差 (MAE) 减少了 3.1--10.1% 和 9.5--44.1% 焦虑,抑郁症为 3.2--9.6% 和 27.4--57.6%(所有 $p$s<0.05)。 TimeSRL 在跨不同传感管道的跨基准传输方面显着优于现有方法,在没有目标域 微调 的情况下可以与它自己的域内性能相媲美。这些结果表明语义抽象是可重用的,并为通过 RL 调整的 LLM 进行泛化行为建模指明了新方向。