论文
时间序列 QA 系统会读取时间序列吗?证据的使用和推理的可靠性
Do Time-Series QA Systems Read the Time Series? Evidence Use and Reasoning Reliability
摘要
近年来,时间序列问答(QA)系统取得了重大进展。然而,生成正确的答案并不能表明保留提供的数字序列是否可以提高任务性能,也不能表明预测是否对该输入的变化敏感。虽然某些系统提供了基本原理,但答案的准确性也无法表明其数字主张是否基于所提供的系列或所陈述的推论是否有效。在这项工作中,我们重点评估四个时间序列 QA 系统:TimeOmni-1、ChatTS、TimeOmni-VL 和 Time-MQA。首先,对于已发布评估数据的三个系统,我们重现了它们报告的结果,并将系统的性能与其骨干模型进行比较。然后,我们引入了一个名为 COMMON-TSQA 的基准,它从现有的时间序列基准中收集公共评估数据集,并统一它们的样本表示、任务定义和答案模式,同时在通用评估标准下通过自己的界面评估每个系统。评估使用原始条件和六种干预措施,同时保持问题和目标固定。我们的分析表明,仅综合性能就可以掩盖系统如何使用数字证据。尽管个人预测发生了重大变化,但仍可能出现类似的任务级别分数。一些干预措施会引发简单的后退行为,而不是保留任务能力。我们还评估事实依据、推理有效性以及与最终答案的一致性的基本原理。我们发现,基本原理通常包含不受输入支持的时间序列主张。此外,理由审核表明,理由与其最终答案之间的一致性可以与不正确的数字描述或无效的中间推论共存。
