论文
用于聚合洞察生成的差分私有语义计划
Differentially Private Semantic Plans for Aggregate Insight Generation
摘要
\texttt{URANIA} 为数据相关集群的摘要提供端到端差分隐私(DP)。然而,它的集群关键字发布并不直接为独立于受保护语料库定义的语义概念提供集合范围的聚合。记录可以表达多个概念,表达相同概念的记录可以分配给不同的集群,并且集群标识不需要在分析之间对应。因此,聚类级别的统计数据并不直接提供跨集合或重复分析的预定义概念的可比较测量。我们引入了 \texttt{DP-SPIN},这是一个可信策展人框架,用于对独立于受保护目标记录固定的语义概念进行聚合测量和总结。每个记录都映射到这些概念上的有界稀疏非负向量,其总和形成语义草图。差异私有机制发布包含公认概念和噪音质量的语义计划;标准化的语义支持值和支持箱是通过后处理获得的。对于用户级隐私,每个用户的总贡献被限制在一个固定的范围内。语言模型仅接收计划和固定解码指令,而公共验证者则检查概念提及、报告值、比较以及针对已发布计划的排名声明。最终摘要通过后处理具有差分隐私性。我们在添加/删除和替换邻接下建立记录级和用户级 DP 保证。我们在 CFPB 投诉叙述、Amazon All Beauty 评论和 Yelp 餐厅评论的记录级隐私下以及在 Amazon 和 Yelp 上的用户级隐私下评估 \texttt{DP-SPIN}。我们将 \texttt{DP-SPIN} 与非私人计划和摘要参考、DP 关键字和类别直方图基线以及具有固定公共关键字词汇的 \texttt{URANIA} 样式基线进行比较。