论文
Lapras:时间序列语言模型的潜在推理
Lapras: Latent Reasoning for Time Series Language Models
摘要
时间序列语言模型 (TSLM) 通过对时间信号进行推理并生成自然语言答案和解释,为时间序列理解提供了一条有希望的途径。一种常见的方法是思维链 (CoT),它生成将相关信号模式与最终答案联系起来的逐步原理。尽管这些模型在训练后从参考 CoT 轨迹中学习,但在推理时生成输入时间序列的忠实描述仍然具有挑战性。用离散语言标记表达高维、连续的时间表示可能会导致模型忽略与任务相关的模式或不准确地描述它们。由于后来的推理步骤建立在这些描述的基础上,因此早期的错误会传播,导致错误的答案以及与输入信号不一致的合理解释。我们提出 Lapras(跨系列的潜在后训练推理),这是一种为 TSLM 配备潜空间推理的后训练框架。用 Lapras 训练的模型通过联合时间序列-语言空间中的一系列连续思维进行推理, 仅为最终答案生成文本。它通过师生自我蒸馏来学习这一点,在参考CoT轨迹上训练的教师通过文本进行显式推理。学生在回答阶段将其隐藏状态与教师的隐藏状态对齐,将教师的推理能力转化为其潜在计算。我们在五个时间序列问答基准的四个 TSLM 主干上评估 Lapras。 Lapras 与显式 CoT 相比,平均F1最多提高10.79%,同时生成的token数量减少了 23.9 倍。Lapras的连续思想也可以通过标准语言解码被解码为可读的推理痕迹,保留文本解释。总之,这些结果凸显了 Lapras 作为一种有前途的训练后范例,可实现高效、有效和可解释的 TSLM 推理。