论文

向量不是中性的:从摘要中导出的 LLM 表示进行敏感信息推断

Vectors Are Not Neutral: Sensitive-Information Inference from Exported LLM Representations in Summarization

模型评测安全与风险评测

摘要

大语言模型 (LLM) 摘要系统可以将私有输入的紧凑向量表示传递到下游检索、监控、审计或分析工作流程。即使源文档仍然受到访问限制,派生向量也可以在不同的访问控制下进行处理,并且仍然支持敏感信息推断,从而产生残余信息泄露风险。我们在临床出院摘要生成中研究这个问题作为高风险案例研究,使用电子健康记录(EHR)记录的种族作为受控敏感标签审核。我们审核系统可能保留或暴露给下游组件的两个工件:最终的提示词元隐藏状态和均值池提示表示。我们的结果表明,降低一个导出工件的案例研究敏感标签的可恢复性并不一定会降低另一个导出工件的可恢复性。作为缓解案例研究,我们引入了 SurfaceLoRA,这是一种以导出向量为目标的参数高效 微调 方法,该方法使用附加到指定导出向量的梯度反转鉴别器。在平衡的五向探测协议下,SurfaceLoRA 将 EHR 记录的竞赛可恢复性从目标最终词元工件降低到机会,同时保留摘要实用性,但从非目标池工件中恢复性仍然要高得多。这些发现表明,应针对保留或暴露给下游组件的确切矢量工件执行隐私审核和缓解措施。