论文

V-FiLLM:经校验的金融大语言模型推理基准

V-FiLLM: Verified Financial LLM Reasoning Benchmark

模型评测基准与评测资源

摘要

尽管现有基准在跨STEM领域评估大语言模型(LLM)方面已取得长足进展,但针对结构化数据的金融推理仍相对较少被探索。我们提出V-FiLLM,一个从基于真实表格的可执行计算树生成金融推理基准的框架,所产生的题目答案由构造即正确。计算树通过符号求值获得真值,并渲染为自然语言问题,从而将任何模型排除在标注环节之外,因此题目能够以任意规模生成,既无标注成本,也不会继承生成器的错误率。V-FiLLM提供四个可独立控制的难度轴,包括计算深度、表达式广度、金融概念复杂度和上下文长度。通过对开源模型的评估,我们发现随着推理深度增加,准确率最多下降51%,在对抗性数值扰动下最多下降47个百分点,凸显了表格上稳健金融推理的剩余挑战。我们进一步表明,在经校验的思维链轨迹上进行轻量级LoRA微调,可将留出问题上的准确率从81.1%提升至85.6%,并在FinQA(Chen et al., 2022a)上超出基础模型5个百分点,这表明有针对性的低成本适配是金融问答中组合推理的一个有前景方向。