论文
TSQAgent:经专门智能体推理评级时间序列数据质量
TSQAgent: Rating Time Series Data Quality via Dedicated Agentic Reasoning
摘要
由于质量维度的多面性,评估时间序列 (TS) 数据的质量至关重要,但本质上也具有挑战性。最近,大语言模型(LLM)已经成为通过成对比较和每维度评估进行 TS 质量评估的有前途的范例。然而,现有的方法依赖于手动预定义的质量维度和纯粹基于文本的推理,因此无法确定大语言模型是否可以识别真正相关的质量维度或进行锚定和定量的质量比较。为了研究这一点,我们构建了 TSQBench,这是一个专门的基准,用于评估大语言模型的两种渐进能力:(i)理解和识别相关的质量维度,以及(ii)在特定维度下进行质量比较。我们的分析表明,目前的大语言模型一直在维度识别和基于证据的质量比较方面遇到困难。为了解决这些限制,我们提出了 TSQAgent,这是一种用于 TS 质量评级的新型代理推理框架,由三个协作角色组成:用于集中维度选择的感知者、用于维度定量分析的检查者以及聚合和细化最终判断的裁决者。特别是,我们引入了一种代理推理策略,该策略赋予识别和优先考虑最相关的质量维度的能力,并进一步提出配备外部分析工具的代理工作流程,以实现对选定维度的精确定量比较。对所提出的基准和十一个真实世界数据集的实验表明,我们的框架不仅大大提高了大语言模型在质量理解和定量比较方面的能力,而且还有效地将这些改进转化为更好的质量感知数据选择,从而提高了下游性能和数据效率。
