论文
REGREACT:用于结构化监管信息提取的自校正多代理管道
REGREACT: Self-Correcting Multi-Agent Pipelines for Structured Regulatory Information Extraction
摘要
从监管文件中提取结构化、机器可读的合规标准仍然是一个开放的挑战。单遍语言模型会产生结构元素的幻觉,失去层次关系,并且无法解决文档间的依赖关系。我们引入了 RegReAct,这是一个自我纠正的多代理框架,它将监管信息提取分解为七个专门的阶段,每个阶段都有一个观察-诊断-修复 (ODR) 循环,根据源验证输出,不仅纠正模型幻觉,还纠正法规本身的交叉引用错误。为了保证结构的准确性,RegReAct构造了一个类型化的准则图;为了确保完整性,它通过检索、总结和内联嵌入引用的法律内容来解决外部依赖关系,从而生成独立的输出。将 RegReAct 应用于三个欧盟分类委托法案,我们构建了一个包含 242 项活动的数据集,其中包含 4,800 多个分层标准、阈值和丰富的源摘要。针对 GPT-4o 单通道基线的评估表明,RegReAct 在所有结构和语义指标上都优于它。