论文

MosaicLeaks:深度研究代理公开查询的隐私风险

MosaicLeaks:Privacy Risks in Querying-in-the-Open for Deep Research Agents

模型评测基准与评测资源

摘要

深度研究代理越来越多地将私有本地文档与网络检索等外部工具结合起来,从而产生隐私风险:代理的外部查询可能会泄露其本地上下文中的敏感信息。这种风险因马赛克效应而被放大,其中单个查询可能看起来无害,但总体而言却变得暴露无遗。我们引入了 MosaicLeaks,这是一个包含 1001 个多跳深度研究任务的基准,该任务将私营企业文档和公共网络语料库链接起来,迫使代理进行依赖于本地信息的外部查询。我们使用对手 LLM 来评估泄漏,该对手仅观察代理的外部查询,并尝试在三个级别推断私人信息:代理的研究意图、特定私人问题的答案以及有关企业文档的可验证声明。我们发现,跨家庭和规模的模型经常在所有三个级别上发生泄漏,零样本隐私提示减少但不能消除泄漏,而仅针对任务性能的强化学习会加剧泄漏。为了解决这个问题,我们提出了隐私感知深度研究(PA-DR),这是一种强化学习框架,它将任务成功的情境奖励与学习的隐私分类器结合起来,为每个查询和马赛克级泄漏提供密集的贡献分配。使用 PA-DR 训练 Qwen3-4B-Instruct 将准确性从 48.7% 提高到 58.7%,并将答案和完整信息泄漏从 34.0% 减少到 9.9%。