使用混合 RAG 和本地部署的大型语言模型自动提取处理活动记录 (RoPA)
Automated Extraction of Records of Processing Activities (RoPA) Using Hybrid RAG and Locally Deployed Large Language Models
摘要
越南《个人数据保护法》(第 91/2025/QH15 号法律)和第 356/2025/ND-CP 号法令于 2026 年 1 月 1 日生效,要求组织建立和维护处理活动记录 (RoPA)。手动 RoPA 准备工作属于劳动密集型工作,而云托管的大型语言模型 (LLM) 可能与数据主权要求发生冲突。我们提出了 RoPA Manager,这是一种使用混合检索进行自动 RoPA 信息提取的系统,该系统结合了 tsvector 上的词汇排名、密集向量搜索、倒数排名融合 (RRF) 和本地部署的 LLM。我们引入了越南 RoPA 基准,其中包含 32 个组织、77 个处理活动、12 个现场组和 4,338 个参考值。评估报告分为三个不同的级别。自动评分器在未调用大语言模型的情况下对扰动数据进行测试,达到 F1 = 0.9493 [0.9436, 0.9548];这衡量的是记分器的鲁棒性,而不是端到端的提取准确性。端到端提取相对于参考标签实现了 50.04-55.25% 的标记覆盖率。两名独立专家审查了 1,558 个参考值(基准值的 35.9%),没有发现错误值,与 PABAK = 0.9936 的一致性为 99.68%。未测量值级精度。在 24 GB GPU 上的 32 个配对场景中,本地部署的 Qwen3.5-27B-GPTQ-Int4 与基于云的 DeepSeek-V4-Flash 没有显着的统计差异(DeepSeek 的差异为 0.20 个百分点,95% CI [-0.93, 1.32],p = 0.72),而 Gemma-4-31B 的表现明显更差(p < 0.01)。