论文
从文档到推理:金融数值推理的经验证合成数据流水线与语义感知微调
From Documents to Reasoning: A Validated Synthetic Data Pipeline and Semantic-Aware Fine-Tuning for Financial Numerical Reasoning
摘要
财务问答 (QA) 已成为评估大语言模型 (LLM) 在涉及复杂数据格式(例如表格、图表和丰富文本叙述)的特定领域任务上的性能的关键基准。虽然最近的进展使模型能够跨模式推理并执行多步算术运算,但性能一致性和评估可靠性仍然存在局限性。特别是,像精确匹配 (EM) 这样的标准评估指标通常无法考虑微小的变化,例如单位或格式的差异、误导性的绩效评估。在这项工作中,我们提出了一个全面的管道,通过高质量的合成数据生成和使用量化低阶适应 (QLoRA) 微调较小的语言模型 (SLM) 来改进金融 QA 系统。我们的管道包括用于合成问题答案生成的积极数据验证,以确保合成问题答案对的相关性和正确性。我们引入了一种新颖的评估指标,该指标匹配从算术表达式计算的答案,而不是真实答案;提供更准确地反映模型推理能力。此外,我们提出了一种修改后的损失函数,它使用语义相似性、我们的新颖评估指标和标准交叉熵来对齐预测和参考表达式,从而提高性能。 ConvFinQA 基准数据集上的实验结果表明,使用合成数据集和提出的损失函数进行微调后,QA 准确性显着提高。
