论文
LLM 编码智能体 可以推理时间序列吗?
Can LLM Coding Agents Reason About Time Series?
摘要
大语言模型 (LLM) 越来越多地用于金融、医疗保健或环境监测领域的自动化决策系统。时间序列数据在这些领域中无处不在,但很难自动处理。 LLM 代理可以分析时间序列吗?我们研究了三种方法:向代理提供原始数值数据、使用 LLM 作为 编码智能体 或两者的组合。在 编码智能体 设置中,模型使用 Python 代码迭代查询数据。使用两个时间序列理解基准,我们表明具有代码访问权限的代理可以比处理原始数据的模型高出高达 10%。然而,即使表现最好的代理仍然错误地回答了大约 22-34% 的问题。为了深入了解模型的策略和推理差距,我们使用强大的 LLM 判断来分析模型输出。我们的分析表明,编码智能体 可以选择适当的统计检验,但常常会错过重要的细微差别。与此同时,能够访问原始数据的模型可以通过粗略计算得出正确的结论。