论文
超越语义相似性:企业信用承保的两阶段非参数检索工作流程
Beyond Semantic Similarity: A Two-Phase Non-Parametric Retrieval Workflow for Corporate Credit Underwriting
摘要
企业信贷承保要求分析师从长达数百页、多种语言的冗长、异构的财务文件中提取可操作的证据。标准检索增强生成(RAG)管道针对语义相似性进行了优化,经常出现主题相关但缺乏决策效用的段落,我们将这个问题称为相似性-效用差距。我们提出了一种两阶段非参数检索架构,将高召回率候选检索与高精度效用排名分开。第一阶段结合词汇检索和密集多语言检索来构建广泛的候选库。第二阶段应用自适应检索控制器,使用查询意图和文档结构信号过滤候选者,然后是 LLM-as-a-Judge 实用评分机制,根据分析有用性而不是语义接近度对段落进行排名。上下文感知提取模块可保持叙述文本和复杂财务表格的结构保真度。该系统完全部署在本地,以满足企业数据治理需求。在具有分析师策划的相关标签的专有金融文档多语言语料库上进行评估后,该系统的性能显着优于简单的检索基线。在超过 800 名信用分析师的生产部署中,文档审查时间从几个小时减少到大约三分钟,这证明了实用程序感知的 RAG 架构对于文档密集型决策支持工作流程的实用价值。