论文
FinRAG-12B:经生产验证的银行依据对齐问答配方
FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking
摘要
大语言模型(LLM)正被各领域快速采用。但银行业因高准确率要求、监管合规与可验证接地回答的需求而阻力重重。我们提出统一、数据高效的接地领域LLM训练框架,在真实部署约束下优化回答质量、引用接地与校准拒答。第一,描述数据生成流水线:结合LLM-as-a-Judge过滤、引用标注与课程学习,仅用1.43亿token。所得12B模型的回答质量高、在引用接地上超越GPT-4.1,相对未调优基座仅有适度引用权衡。第二,提出校准拒答机制:在22%不可回答样本上训练产出12%的「我不知道」率,大幅优于基模型的4.3%不安全水平,同时避免GPT-4.1的过度拒绝(20.2%)。第三,给出从数据治理到量化服务的端到端方法论。系统已部署于40余家金融机构,查询解决率提升7.1个百分点(p<0.001)。此外模型比GPT-4.1快3-5倍、成本低20-50倍。