论文
面向金融应用的时间序列增强生成
Time Series Augmented Generation for Financial Applications
摘要
评估大语言模型(LLM)在复杂量化金融任务上的推理能力是一个关键且尚未解决的挑战。标准基准往往无法隔离智能体解析查询和编排计算的核心能力。为解决这一问题,我们提出一种新的评估方法与基准,旨在严格衡量LLM智能体在金融时间序列分析上的推理能力。我们使用TSAG(Time Series Augmented Generation)框架在一项大规模实证研究中应用该方法,其中LLM智能体将量化任务委托给可验证的外部工具。我们的基准包含100道金融问题,用于比较多个SOTA智能体(如GPT-4o、Llama 3、Qwen2),评估指标涵盖工具选择准确性、忠实度与幻觉。结果表明,能力强的智能体能够以极少的幻觉达到接近完美的工具使用准确性,验证了工具增强范式的有效性。我们的主要贡献是这一评估框架以及关于智能体性能的相应实证洞察,我们将公开发布以推动可靠金融AI的标准化研究。
