论文

HUSH-Bench:测量会话中敏感历史的记忆使用边界

HUSH-Bench: Measuring Memory-Use Boundaries for Sensitive History in Conversational Agents

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

长期记忆有助于会话代理保持会话的连续性,而相关性和当前轮流保证保持不同的决策。我们在一项既定的保守政策下研究这个边界,其中敏感的历史在当前的转折提供了使用它的理由时形成了响应。我们引入了 HUSH-Bench,这是一个包含 2,400 个良性提示的受控基准测试,与包含一个标记的敏感披露和匹配的无记忆引用的历史记录配对。 HUSH-Bench 使用主动历史集成分数(UIS;0--100,越高越差)来衡量主动历史集成,记录标记的披露是否到达生成器,并包括仅在用户是否要求助手使用较早上下文方面不同的配对提示。我们在无记忆、全上下文和三种基于检索的记忆设置下评估了四种模型。对于一种模型,内存访问将 UIS 从接近零提高到 8.9--26.6,对于其他三种模型,将 UIS 从接近 0 提高到 51.3--83.0。检索系统在 23.0%--30.3% 的案例中暴露了标记的披露,而相关敏感条目或摘要仍然可用,并且三个模型继续显示高 UIS。在四个生成器中,明确的邀请将目标记忆摄取分数提高了 27.0--41.3;测量的有用性保持稳定,而平均超出范围则上升。这些结果促使将内存存储、检索、保证和每回合范围视为单独的设计决策。

HUSH-Bench:测量会话中敏感历史的记忆使用边界:论文配图
图 2:HUSH-Bench 施工流程。 LoCoMo 对话被提炼成人物简介;受控历史工厂一个标记每个病例的敏感披露以及三个诊断交互动态;良性探针会被过滤,因此任何情况都不需要敏感的记忆来获得有用的答案;在匹配的记忆条件下的反应由条件盲法官通过人工验证进行评分。