论文
FINESSE-Bench:大语言模型 中金融领域知识和技术分析的分层基准套件
FINESSE-Bench: A Hierarchical Benchmark Suite for Financial Domain Knowledge and Technical Analysis in Large Language Models
摘要
大语言模型 (LLM) 越来越多地应用于财务分析、报告、投资决策支持、风险管理、合规性和专业训练。然而,对其金融领域能力的稳健评估仍然不完整。 FinQA、ConvFinQA 和 TAT-QA 等广泛使用的开放基准在推进财务问答和数字推理方面发挥了重要作用,但它们主要侧重于财务报告的问答,并没有提供明确的专业难度等级。更广泛的资源,包括 FinanceBench、PIXIU、FinBen 和 FLaME,扩大了金融任务的覆盖范围,但评估从基础知识到专家级金融推理的过渡的问题仍然悬而未决。在这项工作中,我们提出了 FINESSE-Bench,这是一套由八个专业基准组成的套件,包含 3,993 个问题,用于 LLM 中财务能力的分层评估。 FINESSE-Bench 结合了受专业认证(类 CFA 1-3 级、类 CMT 2 级和类 CFTe 1 级)启发的面向考试的数据集、应用交易任务集合和俄语奥林匹克基准。这种设计可以评估领域广度、随着难度增加而降低的性能、解决计算任务的能力以及专业金融领域的模型行为。我们还描述了一个统一的评估协议,涵盖多项选择题、数字答案和简短的开放式回答,以及基于 LLM 作为法官范式的自由形式答案的自动评分方案。 FINESSE-Bench 旨在作为现有开放式财务基准的补充,并作为对 大语言模型 中专业相关财务能力进行更实质性评估的工具。