论文

Deep FinResearch Bench:评估AI开展专业金融投资研究的能力

Deep FinResearch Bench: Evaluating AI's Ability to Conduct Professional Financial Investment Research

智能体系统Agent任务评测

摘要

我们提出Deep FinResearch Bench,一个面向深度研究(DR)智能体在金融投资研究中的实用且全面的评估框架。该基准从三个维度评估报告质量:定性严谨性、定量预测与估值准确性,以及论断可信度与可验证性。特别地,我们定义了相应的定性与定量评估指标,并实现了自动化评分流程以支持可扩展的评估。将该基准应用于前沿DR智能体的金融报告,并将其与金融专业人士撰写的报告进行比较,我们发现AI生成的报告在这些维度上仍有差距。这些发现凸显了打造面向金融领域的专业化DR智能体的必要性,我们希望这项工作能为金融研究中DR智能体的标准化基准测试奠定基础。

Deep FinResearch Bench:评估AI开展专业金融投资研究的能力:论文配图
图 1:深度研究代理和专业分析师在四个评估维度上的定性表现(等级:1=差、2=一般、3=良好、4=优秀)。专业分析师比 DR 代理表现出明显的优势。