论文

FIRE:金融智能与推理评估的综合基准

FIRE: A Comprehensive Benchmark for Financial Intelligence and Reasoning Evaluation

模型评测基准与评测资源

摘要

我们提出 FIRE,一个综合基准,用于同时评估 LLM 的理论金融知识及其处理实际业务场景的能力。在理论评估方面,我们整理了来自广受认可的金融资格考试的多样化试题,以评估 LLM 对金融知识的深入理解与应用。此外,为评估 LLM 在真实金融任务中的实用价值,我们提出一个系统化的评估矩阵,对复杂金融领域进行分类,并确保覆盖关键子领域与业务活动。基于该评估矩阵,我们收集了 3,000 道金融情景题,包括带参考答案的封闭式决策题和按预定评分细则评估的开放式题。我们对最先进的 LLM 在 FIRE 基准上进行了综合评估,包括我们最新的金融领域模型 XuanYuan 4.0,作为强大的域内基线。这些结果支持对当前 LLM 在金融应用中能力边界的系统分析。我们公开发布基准试题与评估代码,以促进未来研究。

FIRE:金融智能与推理评估的综合基准
图1:FIRE Benchmark 概览