论文

FinForge:半合成金融基准生成

FinForge: Semi-Synthetic Financial Benchmark Generation

模型评测基准与评测资源

摘要

在金融等专业性高、高风险领域中评估语言模型(LM)仍然是一项重大挑战,原因在于开放、高质量、领域特定数据集的稀缺。现有通用基准覆盖面广,但缺乏评估语言模型真实金融推理能力所需的深度与领域保真度,而这种能力既要求概念理解也要求定量严谨性。为填补这一空白,我们提出FinForge,一个通过专家引导的数据整理与受控的基于语言模型合成相结合来构建金融领域评测基准的可扩展半合成流水线。FinForge将来自权威金融来源的人工与程序化语料构建相结合,并使用Gemini 2.5 Flash进行结构化问题生成与验证。为展示该流水线的效力,我们产出FinForge-5k,一个包含超过5,000个经人工验证的问答对、覆盖11个金融子域的快照基准,其语料来自经整理的100,000份经验证的文档、共143M token。对最先进开源与闭源模型在FinForge-5k上的评测揭示了金融推理能力的显著差异,领先模型的准确率接近80%。这些发现凸显了该框架在诊断当前模型局限和指导未来金融领域能力改进方面的实用价值。全部代码与数据可在 https://github.com/gtfintechlab/FinForge 获取。

FinForge:半合成金融基准生成 配图
图 2:FinForge 流水线包含两个互补阶段。数据策展(左):一个手工与程序化相结合的过程,应用金融分类体系识别权威网站域名,抓取并过滤内容,组装出高质量的金融语料库(Finance Corpus)。问题生成(右):一个由 LM 驱动的五阶段工作流,分析文档以提取突出信息、创建结构化的答案规划、生成带有合理干扰项的自足问题、分配类别标签,并应用基于量规的验证以确保相关性、清晰性与事实准确性。经验证的输出既充实用于基准测试的问答(Q/A)语料库,也反馈回金融语料库以进行迭代精炼。