论文

资本市场 LLM 可靠性评分 (CM-LRS):从合理到可融资

Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable

模型评测评测方法与指标

摘要

在资本市场工作流程中,问题很少不是 大语言模型 是否可以生成流畅的汇票,而是汇票是否可融资:在交易对手或监管机构面前可以在手头有文件的情况下进行辩护。现有方法解决了部分差距:开放域 QA 基准奖励表面准确性,财务基准(FinanceBench、FinQA、ConvFinQA)推进基于文档和数值的 QA,但在问答层而不是从业者捍卫的工作流输出进行评估。我们引入了 CM-LRS,即资本市场 LLM 可靠性评分,从七个维度评估工作流程输出层的输出:事实准确性、证据可追溯性、数字一致性、工作流程完整性、来源纪律、决策有用性和可审查性/可审计性。根据在受监管环境中使用的信号审核员所依据的评分标准,每项评分为 0-5 分;聚合可根据工作流程进行调整。我们在公开的 SEC EDGAR 文件、公开的英国收购发布和虚构的综合补充文件中展示了 CM-LRS 的五个工作流程(DCM 交易条款提取、先例检索、发行人概况综合、并购交易可比推理、ECM 交易条款提取),针对跨越三个模型系列的四名独立 LLM 法官对四个模型进行了评分。三项发现。首先,前沿闭源模型在四位评委平均 CM-LRS 上的聚类分数在 0.22 以内(Sonnet 4.6 = 4.31,Opus 4.7 = 4.30,GPT-5.5 = 4.09);所有四位评委都将开放重量基线(Llama 3.3 70B = 3.15)放在最后。其次,这一差距集中在检索(2.23)和合成(2.15),而不是提取(0.84)。第三,决策有用性显示了任何维度上最广泛的跨模型离散度(发行人分析为 4.0 分)和顶级法官间一致性(平均 r = 0.52)。合理性是廉价的。银行可融资性是标准。