论文
FinForge:半合成金融基准生成
FinForge: Semi-Synthetic Financial Benchmark Generation
摘要
在金融等专业性高、高风险领域中评估语言模型(LM)仍然是一项重大挑战,原因在于开放、高质量、领域特定数据集的稀缺。现有通用基准覆盖面广,但缺乏评估语言模型真实金融推理能力所需的深度与领域保真度,而这种能力既要求概念理解也要求定量严谨性。为填补这一空白,我们提出FinForge,一个通过专家引导的数据整理与受控的基于语言模型合成相结合来构建金融领域评测基准的可扩展半合成流水线。FinForge将来自权威金融来源的人工与程序化语料构建相结合,并使用Gemini 2.5 Flash进行结构化问题生成与验证。为展示该流水线的效力,我们产出FinForge-5k,一个包含超过5,000个经人工验证的问答对、覆盖11个金融子域的快照基准,其语料来自经整理的100,000份经验证的文档、共143M token。对最先进开源与闭源模型在FinForge-5k上的评测揭示了金融推理能力的显著差异,领先模型的准确率接近80%。这些发现凸显了该框架在诊断当前模型局限和指导未来金融领域能力改进方面的实用价值。全部代码与数据可在 https://github.com/gtfintechlab/FinForge 获取。
