论文
大语言模型作为时间序列解释的法官
LLM-as-a-Judge for Time Series Explanations
摘要
评估大语言模型生成的基于时间序列数据的自然语言解释的事实正确性仍然是一个开放的挑战。尽管现代模型生成数字信号的文本解释,但现有的评估方法是有限的:基于参考的相似性度量和一致性检查模型需要地面实况解释,而传统的时间序列方法纯粹基于数值运行,无法评估自由形式的文本推理。因此,在没有预定义参考或任务特定规则的情况下,不存在通用方法来直接验证解释是否忠实于底层时间序列数据。我们在无参考设置中研究大语言模型,作为时间序列解释的生成器和评估器,其中给定时间序列、问题和候选解释,评估器根据模式识别、数字准确性和答案忠实度分配三元正确性标签,从而实现有原则的评分和比较。为了支持这一点,我们构建了一个包含 7 种查询类型的 350 个时间序列案例的综合基准,每个案例都配有正确、部分正确和不正确的解释。我们跨四个任务评估模型:解释生成、相对排名、独立评分和多异常检测。结果显示出明显的不对称性:生成高度依赖于模式,并且在某些查询类型上表现出系统性故障,季节性下降和波动性变化的准确度范围为 0.00 到 0.12,结构断裂的准确度为 0.94 到 0.96,而评估更加稳定,即使模型自己的输出不正确,模型也会正确排名和评分解释。这些发现证明了基于数据的大语言模型对时间序列解释的评估的可行性,并强调了它们作为时间序列域中基于数据的推理的可靠评估者的潜力。