论文
用于混合表格和文本的财务推理的标准答案引导程序化 蒸馏
Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text
摘要
针对混合表格和文本数据的财务问题回答可能需要多源推理和精确的数值计算。虽然 大语言模型 (LLM) 可以生成中间推理步骤,但自然语言基本原理仍然容易出现算术错误,这使得它们成为 蒸馏 不可靠的监督源。在程序化 蒸馏 的基础上,我们开发了一种方法,使用经过执行验证的 Python 程序而不是自由格式的文本原理,将可靠的数字推理从大型教师模型转移到紧凑的学生。它利用标准推导来指导教师端程序合成,并仅保留正确执行并产生标准答案的程序,确保高质量的监督。我们进一步引入迭代恢复阶段,重新审视教师失败的示例,使学生能够恢复并将新验证的程序纳入训练中。 TAT-QA 实验表明,我们的框架对于混合金融推理非常有效。我们最好的 7B 学生在测试集上取得了 87.00 EM / 87.18 F1,大大优于 72B 教师 (78.46 EM) 以及传统且强大的基于 LLM 的基线,包括 TAGOP 和 TAT-LLM。这些结果表明,经过执行验证的编程 蒸馏 提供了一个有效且可扩展的框架,用于训练较小的模型以执行可靠的数值推理。