论文
GRASP:通过组相关策略优化强化语言模型匿名器
GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization
摘要
大语言模型可以从普通文本中推断出敏感的个人属性,例如年龄、地点和职业,将日常书写变成隐私风险。对抗性匿名化通过使用功能强大的语言模型重写文本来防御这种情况,该语言模型也扮演攻击者,但它在推理时需要强大的模型,从而将私人文本发送给第三方,而匿名化应该防止这种情况的暴露。最近的工作使用有监督的 微调 和直接偏好优化(DPO)将这种行为提炼成一个小型的设备上模型,但 DPO 只模仿老师的离线选择,而从不直接优化我们关心的隐私-效用目标。我们引入了 \textbf{GRASP} (\textbf{G}roup-\textbf{R}elative \textbf{A}通过 \textbf{S}elf-refinement \textbf{P}olicy-optimization 匿名化),它通过组相对策略优化在线增强了本地匿名器。单个小模型充当匿名者、对手和效用法官,针对隐藏属性同时保留含义的自我生成奖励进行训练,并采用防范 奖励作弊 的设计。在 Llama-3.1-8B 上进行训练后,\ours{} 改进了 DPO 蒸馏基线上的隐私与实用性权衡,在三位独立的 LLM 法官中保持一致。与 Gemini~2.5~Flash 和 Claude 等前沿模型驱动的对抗性匿名化相比,它实现了相当或更好的总体权衡,同时删除了更多的私人信息,并且它完全在设备上运行,成本约为 GPT-4o 教师成本的 1\%$。