论文
FinDeepIndicator:端到端金融指标构建中的深度研究Agent基准
FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction
摘要
金融指标是将原始金融数据转化为各种下游任务,如估值、风险评估和经济分析等可解释度量的重要工具。然而,现有的金融基准主要关注答案级准确性和假设相关数据已经提供,忽略了指标构建过程中的评估。在这项工作中,我们提出了FinDeepIndicator,这是一个专门用于评估端到端金融指标构建的深度研究(DR)代理基准。具体而言,FinDeepIndicator在指标构建的四个阶段(公式化、数据收集、指标计算和答案生成)上对DR代理进行评估,并将指标分为21个细粒度的子类别,涵盖基础、技术、宏观经济等金融指标。它包含从美国和中国市场中衍生的3,350个问题-答案(QA)对,以及10年的历史金融数据和800家上市公司。对配备搜索能力的大语言模型(LLMs)和DR代理的广泛实验表明,尽管LLMs在公式化阶段表现良好,但在数据检索和数值执行过程中准确度显著下降。DR代理在实际金融分析设置中通常优于配备搜索能力的LLMs,但仍然不可靠。这些发现为在金融领域开发更强大的和可靠的DR代理提供了见解。
