论文

面向真实世界监管合规问答的引用闭包检索与逐规则归因

Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering

上下文与知识检索增强

摘要

将大语言模型(LLM)部署于监管合规场景,要求通过跨多层级权威结构的全面引用实现严格的可追溯性。与传统的多跳问答或法律问答不同,该任务需要结构化的程序性查找与证据集闭包,而非实体消解或判例推理。现有 RAG 系统在此类任务上表现吃力,原因在于被拉平的引用边、碎片化的检索扩展以及脆弱的事后归因。我们通过 RegOps-Bench 对监管合规问答进行形式化,这是一个新基准,其特色是从复杂的国家研发(R&D)法规中导出的运营知识图谱(Operational Knowledge Graph)。为突破这些瓶颈,我们提出由共享主题锚点驱动的统一框架 RefWalk。RefWalk 遍历跨文档引用,通过基于最大值的聚合融合多视图候选,并强制逐条规则归因,将论断显式映射到来源。我们建立了一个强基线,在检索召回率与引用准确率上取得大幅提升。最后,在美国医疗合规数据集(HIPAA)上的对比评估显示,现有系统在扁平结构规则上已趋于饱和,这凸显了对 RegOps-Bench 的需求。我们的代码已发布于 https://github.com/yeongjoonJu/RefWalk。

面向真实世界监管合规问答的引用闭包检索与逐规则归因
图1:RefWalk的总体框架。出于说明目的,这些示例是从韩语原文翻译而来的。文件缩写的定义见表 1(S*:费用使用标准,E*:创新法实施令,N*:创新法)。