FinResearchBench II:基于共识的金标准的深度研究基准,用于区分财务报告质量
FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality
摘要
深度研究代理越来越多地用于生成长篇财务报告,但大规模评估仍然面临瓶颈,因为需要人类专家来定义和执行高质量的评估标准。我们通过提出一个可扩展的管道来解决这个问题,该管道可以在最后的循环中无需人类专家来生成高质量的评分标准。我们根据 104 个真实用户查询构建了金融深度研究基准,并从模型生成的报告中自动合成 14,450 个特定于查询的候选评分标准。为了证明从评分标准执行中删除人类专家的合理性,我们将三名人类专家的评分标准判断与三个 LLM 评审小组对抽样子集的评分标准判断进行了比较,并表明基于 LLM 的评估与人类评估足够一致,可以取代它进行大规模评分标准筛选,包括在联合一致项目上的标签级一致性达到 98.67%。然后,我们通过两个过滤器得出共识衍生的标准评价规则:严格一致性过滤器,仅当三位 LLM 法官一致同意同一查询下的每份报告时才保留评价标准;以及可区分性过滤器,仅当它在评估的系统中分配至少一个多数赞成和至少一个多数反对标签时才保留评价标准。此过程保留了 3,687 个通过一致性的评分标准,其中 2,600 个仍然可区分,并形成最终的一组共识衍生的黄金评分标准。使用这个最终的评分标准集,我们在 10 个深度研究系统中获得了明显差异化的排名,项目级通过率范围从 58.58\% 到 22.23\%。更广泛地说,由于该管道从标题生成和评估中消除了人类专家的执行,因此它自然可以扩展用于基准评估、自动系统比较以及评估驱动的系统改进的未来研究。