论文

差分隐私语言模型中的隐私与幻觉权衡

The Privacy-Hallucination Tradeoff in Differentially Private Language Models

模型评测模型行为与机制分析

摘要

在医疗保健等高风险领域,隐私和事实准确性至关重要。令人担忧的是,我们发现并研究了差分隐私(DP)语言模型中的隐私幻觉权衡。首先,我们凭经验表明,使用 DP 进行预训练或微调的模型往往比非 DP 模型产生更多的幻觉,并且随着隐私预算变得更加严格,幻觉的严重性也会增加。其次,我们研究了驱动这种权衡的模型属性,证明了 DP 机制使输出分布平坦,有可能将概率质量重新分配给实际上不正确的替代方案。第三,通过控制训练数据中的事实频率的实验,我们描述了信息频率如何降低 DP 模型中的幻觉风险。总体而言,我们的研究结果强调需要采取更细致的隐私保护干预措施,在不损害事实准确性的情况下提供严格的隐私保证。

差分隐私语言模型中的隐私与幻觉权衡:论文配图
((a)) Avg. oblicity ((b)) Avg.事实图1:关于维基百科科学的(a)和(b)平均问题,16\varepsilon=16诉Zavarepsilon=infty。DP型调整模型通常达到较低的平均迷惑度(y=xy=x线以上点),但非DP型模式在专题上取得更高的平均事实分数——表明较低的困惑并不意味着更好的事实。