论文
TimeThink:激发时间序列大语言模型的组合推理
TimeThink: Eliciting Compositional Reasoning in Timeseries Large Language Models
摘要
时间序列多模态大语言模型(TS-MLLMs)近期开始利用大语言模型(LLMs)的推理能力处理问答任务。然而,这些模型往往无法捕捉动态时序模式,仅能提供隐式推理,缺乏高风险场景(如医疗)所需的核心解释。基于强化学习(RL)的时间序列语言模型试图解决这一问题,但通常受限于窄范围、分布内数据的训练,难以应对分布外的组合性问题。为应对这些挑战,我们提出了TimeThink,一种用于激发时间序列组合推理的合成框架。核心时间序列基本单元(如趋势、季节性)具有领域无关性,可确定性生成。基于此前提,TimeThink首先设计了一种合成数据生成器,生成原子级和复合级的问题-答案对,提供带有推理轨迹的客观真实标签。在此基础上,TimeThink采用强化学习结合可验证奖励(RLVR)的训练策略,以促进显式推理。与依赖模板的方法不同,该方法使模型能够学习组合推理的底层逻辑,而非简单模仿推理轨迹。大量实验表明,仅在合成数据上训练的TimeThink在合成和真实世界基准上均显著优于强基线模型。
