论文

从 大语言模型 中提取符合人性化的隐私敏感性评估

Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models

摘要

文本数据的准确隐私评估仍然是保护隐私的自然语言处理中的关键挑战。最近的工作表明,大语言模型(LLM)可以作为可靠的隐私评估器,与人类的判断达成高度一致;然而,它们的计算成本和大规模处理敏感数据的不切实际限制了实际部署。我们通过将 Mistral Large 3 (675B) 的隐私评估功能提炼成参数少至 150M 的轻量级编码器模型来解决这一差距。利用跨越 10 个不同领域的隐私注释文本的大规模数据集,我们训练高效的分类器,这些分类器与人类注释保持强烈的一致性,同时大大降低计算要求。我们在人工注释的测试数据上验证了我们的方法,并证明了其作为去识别系统评估指标的实用性。