论文

金融服务LLM评估的元基准

Meta-Benchmarks for Financial-Services LLM Evaluation

模型评测评测方法与指标

摘要

公开LLM排行榜优化全局平均性能——无法捕捉金融服务工作的特定认知需求:在MMLU-Pro领先的模型可能在文档锚定的合规推理上表现不佳——编程领先者可能难以处理多轮客户交互。我们提出元基准测试框架——将452个公开报告的基准组织为41项O*NET通用工作活动——再聚合为横跨销售、运营、风险与支持工作的38个BIAN银行业务域。乘法加权方案(区分度×覆盖率×新近度)在滚动模型窗口上计算——奖励仍能区分最佳模型、被广泛报告且仍在活跃使用的基准——自动抑制已饱和的遗留测试。这些权重缩放成对Elo锦标赛中的K因子——产生跨基准可比的工作活动分数而无需原始分数归一化;业务域分数为组成工作活动Elo的加权平均。我们在覆盖截至2026年6月25个组织288个模型的时间点公开快照上演示该框架——并描述方法学、完整分类法、设计决策与局限——目标是让面临类似选择与治理挑战的机构可复现该方法。

金融服务LLM评估的元基准:论文配图
图 5:2022-2026 年选定编码基准的歧视热图。单元格强度代表每个月结束的 12 个月滚动窗口内前 10 个模型得分的归一化标准差(灰色 = 无数据;深蓝色 = 最大区分度)。 HumanEval 和 MBPP 较早饱和; LiveCodeBench 变体和代理基准(SWE-Bench、Aider)将前沿分离维持到 2026 年。