论文
MemLeak:诊断多模式代理内存中的信息泄漏
MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory
摘要
当多模式人工智能代理被要求忘记一个事实时,当前的记忆系统通常会删除文本输入并报告成功。我们发现事实仍然可以从保留的用户图像中恢复,包括标记为完全不同事实的图像,因为 VLM 在推理时使用隐式视觉提示。我们引入了信息来源图(IPG),这是一种通过删除可供性对记忆表示进行分类的分类法。 IPG通过多种渠道透露删除失败。我们的基准 MemLeak 通过删除级联来衡量这一点:直接探测具有删除功能的系统的收益率 <1%,但保留的相关文本可实现 18.3% 的恢复,保留的图像可实现 12.0% 的恢复(0.0% 盲基线,0.3% FPR)——其中 47% 的图像泄漏不可通过文本恢复。内容感知语义删除将图像残差降低至 2.0%。残差出现在多个 VLM、一个生产存储系统和真正的 Unsplash 许可的照片中。双注释器人工验证(kappa = 0.88)证实了判断的可靠性。