论文
BizFinBench.v2:专家级财务能力对接的统一双模双语基准
BizFinBench.v2: A Unified Dual-Mode Bilingual Benchmark for Expert-Level Financial Capability Alignment
摘要
大语言模型经历了快速发展,成为金融运营智能的关键技术。然而,现有的基准通常受到陷阱的限制,例如依赖模拟或通用样本以及关注单一的离线静态场景。因此,它们无法满足金融服务真实性和实时响应性的要求,导致基准性能与实际运营效率之间存在巨大差异。为了解决这个问题,我们推出了BizFinBench.v2,这是第一个基于中国和美国股票市场真实商业数据、集成在线评估的大规模评估基准。我们对来自金融平台的真实用户查询进行了聚类分析,得到了涵盖四个核心业务场景的 8 个基础任务和 2 个在线任务,总计 29,578 个专家级问答对。实验结果表明,ChatGPT-5 在主要任务中的准确率达到了 61.5%,尽管与金融专家相比仍存在很大差距;在在线任务中,DeepSeek-R1 的表现优于所有其他商业大语言模型。误差分析进一步识别了实际金融业务环境中现有模型的具体能力缺陷。 BizFinBench.v2超越了当前基准的局限性,实现了LLM金融能力的业务层面解构,为评估LLM在金融领域广泛部署的有效性提供了精确的基础。数据和代码可在 https://github.com/HiThink-Research/BizFinBench.v2 获取。
