论文

语义还是结构?审核多模式时间序列预测中的文本敏感性

Semantics or Structure? Auditing Text Sensitivity in Multimodal Time-Series Forecasting

模型评测模型行为与机制分析

摘要

多模态时间序列预测已成为一种有前途的范例,其中自然语言上下文有望提高预测性能。最近的多模态基础模型(包括 Aurora)以及早期和后期融合方法(例如 MM-TSFlib 和 TaTS)报告在 Time-MMD 基准上比单模态基线取得了实质性进展,并将这些改进归因于文本信息。然而,这些模型是否真的对文本的语义内容敏感仍有待验证。我们通过受控文本扰动、归因分析和 Aurora 文本路径探测来解决这个问题。在 Time-MMD 上,将每行文本交换为任何其他真实文本(空、常量、域内混洗或跨域)在所有三种架构上的平均 MSE 移动量小于 $0.5\%$。当删除共同发布的数字列而不触及文本时,文献中报告的改进得以恢复。我们的结论是,在这个基准测试中以及在这个冻结编码器架构系列中,文本内容并不是所报告的增益背后的操作信号。为了支持未来在结构化数据多模式基础模型中进行文本集成的工作,我们将扰动协议和评估工具作为可重用的诊断工具包发布。