论文

LADFA:利用大语言模型与检索增强生成分析隐私政策中个人数据流的框架

LADFA: A Framework of Using Large Language Models and Retrieval-Augmented Generation for Personal Data Flow Analysis in Privacy Policies

上下文与知识检索增强

摘要

隐私政策帮助人们了解组织的个人数据处理实践,涵盖数据收集、数据存储以及与第三方共享个人数据等不同方面。由于使用的法律语言冗长复杂,加上不同行业与组织的做法不一致,人们往往难以完全理解隐私政策。为帮助对隐私政策开展自动化、大规模分析,许多研究者研究了机器学习与自然语言处理技术的应用,包括大语言模型(LLM)。虽然此前已有少量研究利用 LLM 从隐私政策中抽取个人数据流,我们的方法在这一工作脉络之上,将 LLM 与检索增强生成(RAG)以及基于现有研究定制的知识库相结合。本文介绍 LADFA 的开发,这是一个端到端计算框架,可以处理给定隐私政策中的非结构化文本,抽取个人数据流并构建个人数据流图,再对数据流图进行分析以辅助洞察发现。该框架由预处理器、基于 LLM 的处理器和数据流后处理器组成。我们通过一项案例研究演示并验证了所提方法的有效性与准确性,该研究考察了从汽车行业选取的十份隐私政策。值得注意的是,LADFA 的设计灵活且可定制,因此也适用于隐私政策分析之外的一系列基于文本的分析任务。

LADFA:利用大语言模型与检索增强生成分析隐私政策中个人数据流的框架
图1:LADFA 架构