论文
TS-Skill:评估时间序列问答分析能力的基准
TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering
摘要
大语言模型 (LLM) 和时间序列语言模型 (TSLM) 越来越多地应用于时间序列问答 (TSQA)。与纯文本 QA 不同,TSQA 需要模型在时间信号中提供答案,这些信号的模式可能出现在不同的尺度、特定的时间位置或跨越不同的时间间隔。然而,现有的基准通常是按任务类型或高级推理类别组织的,因此很难诊断驱动模型性能的底层信号级功能。我们引入了 TS-Skill,这是一个用于评估 TSQA 中三种可组合分析技能的受控基准:时间尺度选择 (SK1)、时间定位 (SK2) 和跨区间集成 (SK3)。 TS-Skill 提供时间戳感知问题、广泛的领域覆盖范围和经过人工验证的 QA 质量。为了大规模构建基准,我们开发了 SKEvol,这是一个技能引导的代理框架,它结合了领域感知时间序列种子生成、技能控制问题生成、元数据和代码辅助答案构建、多阶段信号验证和人机交互管理。对十个最先进的 LLM 和 TSLM 进行的实验揭示了 SK1-SK3 之间巨大且不均匀的能力差距。特别是,SK3 对于非智能体模型始终具有挑战性,而工具增强智能体则在独立 SK3 上表现出选择性优势。这些发现表明,技能水平评估可以发现被 TSQA 总分掩盖的时间推理失败。