论文

文字真的有帮助吗?发现并解决多模态时间序列预测中的文本崩溃

Does Text Actually Help? Uncovering and Resolving Text Collapse in Multimodal Time Series Forecasting

模型训练监督微调与指令调优

摘要

多模态时间序列预测将数值序列与领域相关的文本报告配对,有望将世界知识注入预测管道。然而,我们发现了现有框架中的一个关键故障模式,我们称之为文本崩溃:文本分支收敛到与内容无关的转换,无论输入描述如何,都会贡献可忽略不计的判别信号。我们认为,文本崩溃是时间序列预测中基本不对称的结果:数值输入与输出强自相关,使得数值主干本质上占主导地位,而文本分支尽管携带补充且通常是关键信息,但未得到充分利用,导致其系统性开发不足。为了解决这个问题,我们提出了 \textbf{REST-TS} (\textbf{R}esidual-\textbf{E}xclusive \textbf{S}supervision for \textbf{T}ext in \textbf{T}ime \textbf{S}eries),它将不对称性转化为设计原则:数值主干产生自己独立的数值预测,文本分支被专门监督来预测残差的结构化分量,预测间隙数字无法解释。由于没有任何数值途径可以减少这些损失,因此文本分支必须从输入描述中提取真实内容。经过对不同现实世界领域和骨干架构的评估,REST-TS 实现了最先进的性能,并始终表现出比现有框架更高的文本分支利用率,提供了强有力的经验证据,证明监督残差上的文本分支迫使它从输入中提取真实内容。