论文

FinReportBench:衡量和改进机构级财务报告的生成

FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation

模型评测基准与评测资源

摘要

大语言模型 可以生成流畅的财务分析,但仅流畅性并不能确定报告是否适合机构交付。我们推出 FinReportBench,这是一个基于专家的基准,用于衡量和改进机构级财务报告的生成。专家审查揭示了报告身份、机构组成、来源纪律和视觉传达方面反复出现的差距。我们通过专家部分订单、多模式证据和决策边界审核得出了一个包含 35 项的评分标准,涵盖可交付性、报告身份和机构完整性。从 10,000 条平衡的中英文金融研究源记录开始,我们策划了跨三个研究对象和两个输入层的 244 个双语任务。每个任务都将公共查询、重建的研究轨迹和隐藏的源数据包分开。三个独立的法官家庭以接近上限的速度再现了专家偏序,表明有界的、可观察的标准支持可靠的评估。在九个模型系列中,基本交付能力几乎饱和,而报告身份和机构完整性仍然是主要瓶颈。最大的跨模型差距涉及生成跟踪控制、信息密度和数据规则,而不是基本报告框架。然后,我们使用基准引导技能 蒸馏 将反复出现的故障转化为可重用的生成和自我审查约束。在五个模型系列中,与配对无技能运行相比,进化后的技能将平均 G1 提高了 33.85 点,将平均 G2 提高了 13.83 点,同时保留了每对的 G0。代码和基准工件可在 https://github.com/MisterBrookT/finreportbench 上获取。