论文

大语言模型中的隐私个性化权衡:风格信号减少对用户特定文本生成的影响

Privacy Personalization Trade offs in LLMs: The Impact of Stylometric Signal Reduction on User-Specific Text Generation

模型评测安全与风险评测

摘要

大型语言模型 (LLM) 已证明能够生成具有高风格保真度的用户特定文本。然而,实现这种个性化的个人数据经常嵌入人口统计、文化和风格标记,这引起了对风格重新识别的担忧。本文研究了减少可识别的风格信号是否会影响大语言模型文本生成的个性化。我们引入了一个受控框架,使用 LaMP-7 Twitter 基准来隔离 LLM 个性化中的风格测量信号。对 250 名抽样用户进行的实验比较了两种设置:以原始个人资料为条件的释义和以匿名转换个人资料为条件的释义,其中人口统计标识符、文化参考、个人详细信息和非正式语言线索已被系统地中和。输出由两名独立的大语言模型法官和补充的人工评估进行评估。我们的成对评估表明,以原始资料为条件的输出与人类创作的基本事实几乎没有区别,这表明现代大语言模型可以足够保真地再现作者的写作风格。相比之下,对具有匿名配置文件的模型输出的偏好平均下降至 13.0%,而语义上下文保留仍然高达 94.8%。人类评估者的一项研究证实了同样的模式。这些发现揭示了明显的隐私与个性化权衡,并强调需要具有隐私意识的个性化方法,该方法在保留意义的同时抑制识别风格信号。