论文

TimeLitmus:事件条件时间序列预测中跨模态理解与解释忠实度的诊断基准

TimeLitmus: A Diagnostic Benchmark for Cross-Modal Understanding and Explanation Faithfulness in Event-Conditioned Time-Series Prediction

模型评测基准与评测资源

摘要

大语言模型(LLM)越来越多地被用于结合数值时间序列历史与文本事件进行预测。然而,仅凭准确率无法判断正确答案究竟来自对两种输入的有效整合,还是来自事件极性、单模态先验或表面线索;同样,看似合理的解释可能只是在为预测找理由,并未忠实反映驱动模型行为的证据。我们提出 TimeLitmus,一个面向事件条件时间序列预测中跨模态理解与解释忠实度的诊断基准。TimeLitmus 在金融与交通两个领域包含 4,856 条评估记录,将自然预测与受控的反事实、对比干预相结合,并配备面向解释的忠实度测试与系统性的捷径控制。在十个代表性 LLM 上,标准预测准确率大幅高估了可靠的跨模态理解:困难配对对比(HPC)题对的正确率在金融领域最高仅 19.2%,交通领域仅 11.7%,且全部十个模型在金融序列侧控制上的一致性低于预期。模型往往能显式识别情境关系,却在独立预测时无法应用它们。解释忠实度呈现类似差距:在交通领域,多数模型在超过 90% 的案例中引用了被操纵的时间因子,而行为支持度却低于 22%。人类标注者在匹配的受控与困难配对诊断上优于 LLM,证实这些区分可以从输入中恢复。仅用自然数据的适配在证据选择和输入敏感性上带来部分收益,但在受控或困难配对行为上收益并不一致。基准、评测套件与有监督适配数据将公开发布。

TimeLitmus:事件条件时间序列预测中跨模态理解与解释忠实度的诊断基准:论文配图
图 2:TimeLitmus 概览。受控干预与忠实性诊断检验事件条件化的预测与解释是否依赖预期的跨模态证据而非捷径。