论文

从弱线索到真实身份:评估LLM智能体中推理驱动的去匿名化

From Weak Cues to Real Identities: Evaluating Inference-Driven De-Anonymization in LLM Agents

模型评测安全与风险评测

摘要

匿名化被广泛视为一种实用的保障措施,因为重新识别匿名记录历来成本高昂,需要领域专业知识、定制算法和手动验证。我们研究了日益增长的隐私风险,该风险可能会削弱这一障碍:基于大语言模型的代理可以根据分散的、单独的非识别线索自主重建现实世界的身份。通过将这些稀疏线索与公共信息相结合,代理无需定制工程即可解析身份。我们将这种威胁形式化为 \emph{推理驱动的链接},并在三种设置中系统地评估它:经典链接场景(Netflix 和 AOL)、\emph{InferLink}(一个受控基准,不同的任务意图、共享线索和攻击者知识)和现代文本丰富的工件。无需特定于任务的启发式方法,代理即可成功执行固定池匹配和开放式身份解析。在 Netflix 大奖设置中,代理重建了 79.2% 的身份,显着优于 56.0% 的经典基线。此外,链接不仅在明确的对抗性提示下出现,而且还是 \emph{InferLink} 和非结构化研究叙述中良性跨源分析的副产品。这些发现表明,身份推断——而不仅仅是明确的信息披露——必须被视为一流的隐私风险;评估必须衡量智能体可以推断出的身份。

从弱线索到真实身份:评估LLM智能体中推理驱动的去匿名化:论文配图
图 1:推理驱动链接概述。我们证明了 LLM 代理可以从碎片信息中重建特定身份 (ı^\hat{\imath})。 (左)匿名工件 (DanonD_{\text{anon}}):ChatGPT 日志、AOL 搜索历史和采访记录等来源包含碎片化的、单独的非识别线索,这些线索可以在给定工件内共同形成与身份相关的配置文件。 (右)辅助上下文(DauxD_{\text{aux}}):辅助信息可以直接提供,也可以从公共来源(例如网络、社交媒体和新闻)检索,并作为佐证证据。 (中)代理推理:代理将来自匿名工件的微弱线索与确凿的辅助上下文相结合,形成连贯的身份假设。