论文

领域适配RAG用于金融合规问答:检索改善不等于回答依据可靠

Automated Regulatory Compliance Question Answering in Financial Services with Domain-Adapted Retrieval-Augmented Generation

上下文与知识检索增强

摘要

金融机构依据密集且经常修订的规则运作,正确回答合规问题不仅需要语言流畅,还需要能核验其权威文本依据。大语言模型适合这一任务,但企业能够本地部署的往往是较小模型,而它们可能编造监管义务。本文研究经过领域适配的检索增强生成流程能否弥补这一问题。检索器基于LegalBERT分三阶段构建:通过蕴含训练将问题—段落匹配改写为前提—假设重建,采用批内负样本进行对比训练,再与BM25在分数层融合。生成器为2B至12B参数模型,以4位量化提供服务,通过提示或LoRA进行检索感知微调(RAFT)。在根据阿布扎比全球市场规则构建的ObliQA基准上,分阶段检索器将Recall@10从0.256提高至0.774,超过BM25的0.678及受测最强通用稠密编码器E5-large-v2的0.758。RAFT-LoRA提高了所有可适配模型的综合RePASs回答质量分数,较弱模型增幅最大。然而,这些适配模型未能迁移到澳大利亚判例问题;完全不接收段落的闭卷模型得分与完整流程相差不超过0.011 RePASs,却不给出处且错误表述监管义务。因此,检索改善已被直接测量,生成改善只是RePASs分数上升,并未证明回答依据可靠;核验这一能力需要RePASs没有提供的专门评估协议。