论文

LineupRL:以描述—序列识别训练时间序列描述模型

LineupRL: Verifiable Reinforcement Learning for Time Series Captioning via Caption-to-Series Identification

模型训练强化学习RLVR

摘要

生成时间序列描述是理解时间序列的基础步骤,也能连接信号与自然语言。监督微调(SFT)依赖更大模型生成的描述,其质量无法超过这些描述。强化学习(RL)可以突破这一限制,但现有奖励针对其他模态与任务设计,难以迁移到时间序列领域的开放式生成。我们提出LineupRL:以描述—序列识别为奖励的可验证奖励强化学习(RLVR)流程。奖励模型是冻结的大语言模型(LLM)验证器,读取生成的描述和候选时间序列的原始数值,而不读取图表,并须从多个干扰序列中选出描述所指的序列。匹配相比生成问题或评价描述,对验证器的要求低得多,因此现成LLM即可提供奖励。在两个描述生成基准,以及预测器只能看到描述的预测和重建任务中,LineupRL在所有指标上均优于SFT和RL基线。LineupRL训练的3B视觉语言模型(VLM)还超过了为SFT基线提供蒸馏描述的72B VLM,参数量仅为其1/24。案例研究表明,LineupRL能抵抗奖励黑客攻击,所训练的描述生成器既能追踪趋势,也能指出关键时点的数值。