论文
以数据为中心的 后训练 用于金融推理:挖掘、蒸馏 和可验证学习
Data-Centric Post-Training for Financial Reasoning: Mining, Distillation, and Verifiable Learning
摘要
金融文本、教科书和问答对非常丰富,但只有一小部分可以直接用于推理型 后训练。现有的 QA 对通常缺乏明确的推理、足够的上下文或可靠的可验证答案,而教科书必须首先转化为综合训练示例。我们提出了一个以数据为中心的管道,通过挖掘开源推理轨迹、提炼金融指导数据以及从金融教育材料生成知识图引导的问答对来构建互补语料库。在语义去重之后,三个轻量级序列分类器选择与金融相关的示例,拒绝未指定的问题,并通过紧凑的基于规则的验证器识别适合强化学习的任务。对于模型适应,我们研究有监督的 微调 和强化学习,同时使用自蒸馏的 微调 和 后训练 模型合并来防止起始模型中已存在的财务能力的损失。我们使用 FINESSE-Bench 评估调整后的语言模型,报告总体性能和相对于起始检查点的变化。在选定的比较中,普通 SFT 将 FINESSE-Bench 精度降低了 3.2-4.0 个百分点,而自蒸馏 SFT 比相应的起始模型提高了 1.0-2.8 个百分点。等权重合并比其 SFT 父模型恢复了 3.0 个点,并比原始模型高出了 0.9 个点;困难任务上的 GRPO 在自蒸馏 SFT 后增加 0.4 分,或者直接应用于可验证任务时增加 3.0 分。这些结果表明,保留感知适应可以改善财务推理,而不会出现普通 SFT 后观察到的回归。