论文

FinRiskAtlas:面向金融风险审查的大语言模型决策对齐评估

FinRiskAtlas: Decision-Aligned Evaluation of Large Language Models for Financial Risk Review

模型评测基准与评测资源

摘要

将大语言模型部署于专业金融审查,所需的不只是衡量其一般金融能力:模型必须执行工作流所要求的特定审查操作,并判断现有证据是否足以支撑一个可辩护的决策。现有金融基准涵盖知识、推理、合规与专业任务,但其评估单元往往围绕数据集或任务形式组织,而非围绕已部署系统所支持的决策。我们推出FinRiskAtlas,一个中文基准,从两个互补维度评估金融大语言模型:固定证据状态下的操作执行,以及不断演变的审查条件下的证据状态控制。静态基准包含跨53个任务族的9,742个实例,其中包括42个领域知识任务族,以及由明确评估契约定义的十一个下游审查操作。FinRisk-Ask通过对来自104条去标识化专业轨迹的680个动作前状态的离线回放扩展了这一框架:在推理时扣留未来证据,仅将其用于构建经专家验证的证据目标。在33个模型配置上,操作级评估产生了非冗余的排名(各下游操作间的平均两两Spearman相关系数为0.42),而基于知识的初筛在个别操作上可能带来高达18.01分的遗憾值(regret)。FinRisk-Ask还表明,更频繁地进入Ask分支并不一定能改善请求的针对性或端到端的证据获取。这些结果表明,宽泛的金融能力分数并不能完全刻画模型在专业工作流中的可靠之处,这也促使评估单元与已部署系统必须支持的决策及证据状态对齐。

FinRiskAtlas:面向金融风险审查的大语言模型决策对齐评估:论文配图
图1:FinRiskAtlas 的构成。静态基准评估模型能否在固定证据状态下执行指定的金融审查操作。FinRisk-Ask 评估模型在中间审查状态下应当继续推进还是获取更多证据,以及在选择提问后,该请求是否指向有轨迹支持的未决需求。静态实例与轨迹状态代表不同的评估单元,分别进行评估。