论文
差分隐私语言模型中的隐私与幻觉权衡
The Privacy-Hallucination Tradeoff in Differentially Private Language Models
摘要
在医疗保健等高风险领域,隐私和事实准确性至关重要。令人担忧的是,我们发现并研究了差分隐私(DP)语言模型中的隐私幻觉权衡。首先,我们凭经验表明,使用 DP 进行预训练或微调的模型往往比非 DP 模型产生更多的幻觉,并且随着隐私预算变得更加严格,幻觉的严重性也会增加。其次,我们研究了驱动这种权衡的模型属性,证明了 DP 机制使输出分布平坦,有可能将概率质量重新分配给实际上不正确的替代方案。第三,通过控制训练数据中的事实频率的实验,我们描述了信息频率如何降低 DP 模型中的幻觉风险。总体而言,我们的研究结果强调需要采取更细致的隐私保护干预措施,在不损害事实准确性的情况下提供严格的隐私保证。
