论文

TimeThink:激发时间序列大语言模型的组合推理

TimeThink: Eliciting Compositional Reasoning in Timeseries Large Language Models

模型训练强化学习合成数据RLVR

摘要

时间序列多模态大语言模型(TS-MLLMs)近期开始利用大语言模型(LLMs)的推理能力处理问答任务。然而,这些模型往往无法捕捉动态时序模式,仅能提供隐式推理,缺乏高风险场景(如医疗)所需的核心解释。基于强化学习(RL)的时间序列语言模型试图解决这一问题,但通常受限于窄范围、分布内数据的训练,难以应对分布外的组合性问题。为应对这些挑战,我们提出了TimeThink,一种用于激发时间序列组合推理的合成框架。核心时间序列基本单元(如趋势、季节性)具有领域无关性,可确定性生成。基于此前提,TimeThink首先设计了一种合成数据生成器,生成原子级和复合级的问题-答案对,提供带有推理轨迹的客观真实标签。在此基础上,TimeThink采用强化学习结合可验证奖励(RLVR)的训练策略,以促进显式推理。与依赖模板的方法不同,该方法使模型能够学习组合推理的底层逻辑,而非简单模仿推理轨迹。大量实验表明,仅在合成数据上训练的TimeThink在合成和真实世界基准上均显著优于强基线模型。

TimeThink:激发时间序列大语言模型的组合推理:论文配图
图 1:TimeThink 概述。 (A,B) 合成数据生成:程序化生成器构建针对单个基元的原子 QA、链接多个运算符的复合 QA 以及针对看不见的任务轴的分布外 (OOD) QA。 (C) LLM 驱动的 QA 演变:模板化 QA 演变为更复杂、多样化的变体,并保留推理轨迹(<think> 块),以便响应保持基于时间序列属性。 (D) 训练阶段优化:阶段 1 (SFT) 在锚点长度 T≤256T\leq 256 处对程序推理轨迹进行微调;第 2 阶段 (RLVR) 应用 GRPO 来激励自主写作,并将范围扩展到 T≤768T\leq 768,除了格式奖励之外,还使用四个答案类别(二元、邻近、分类、Set-F1F_{1})的可验证奖励 (rfmt+ransr_{\mathrm{fmt}}+r_{\mathrm{ans}})。