论文
迈向可验证的智能体数据科学:经工具锚定求解不规则TSQA
Towards Verifiable Agentic Data Science: Solving Irregular TSQA Via Tool-Grounded Reasoning
摘要
现实世界部署中的时间序列数据绝大多数是不规则的。观察是异步的,缺失值是信息性的而不是随机的,并且采样频率因传感器和操作窗口而异。然而,现有的时间序列问答(TSQA)基准大多假设定期采样输入,这在理解大型语言模型(LLM)和人工智能代理在不规则条件下的表现方面存在根本差距。为了弥补这一差距,我们引入了 IRTS-ToolBench,这是一个包含 1,700 个问题的基准测试,涵盖 13 个领域的 10 种任务类型。 IRTS-ToolBench 旨在供任何从事基于 LLM 的不规则时间序列分析的研究人员独立使用,提供标准化输入和可重复的评估协议。代码可以在 https://github.com/SanhornC/IRTS-ToolBench 中找到。
