论文
通过过程可验证思维数据合成与调度实现面向时间序列的定制LLM推理
Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning
摘要
时间序列是各类应用领域普遍存在的数据类型,这使合理求解多样化时间序列任务成为一个长期目标。大语言模型(LLM)的最新进展,尤其是其通过强化学习(RL)解锁的推理能力,为以长思维链(CoT)推理处理任务开辟了新的机会。然而,将LLM推理用于时间序列仍处于起步阶段,阻碍包括:缺乏精心整理、可用于训练的时间序列CoT数据;数据调度探索不足导致的有限数据效率;以及缺少专为利用此类时间序列CoT数据而设计的RL算法。本文提出VeriTime,一个通过数据合成、数据调度与RL训练为时间序列推理定制LLM的框架。首先,我们提出一个数据合成流水线,构建带有过程可验证标注的TS-text多模态数据集。其次,我们设计了一种数据调度机制,依据有原则的难度层级与任务分类体系安排训练样本。第三,我们开发了两阶段强化微调,其特点是利用可验证的过程级CoT数据提供细粒度、多目标奖励。大量实验表明,VeriTime在多样化时间序列推理任务上显著提升LLM性能。值得注意的是,它使紧凑的3B、4B模型达到与更大规模专有LLM相当乃至超越的推理能力。
