论文
记忆是上下文相关的吗?超越孤立前缀的基于前缀的提取
Is Memorization Context-Sensitive? Prefix-Based Extraction Beyond Isolated Prefixes
摘要
大型语言模型 (LLM) 可以在基于前缀的提取下公开记忆的训练序列:给定训练示例中的前缀,模型可以为原始延续分配高概率。然而,在已部署的系统中,很少单独评估前缀。它们通常与指令、检索到的文档或其他特定于任务的上下文一起出现,如检索增强生成 (RAG)。这促使人们检查情境条件是否会减轻记忆,或者仅仅改变可提取的记忆样本集。我们通过概率后缀提取的配对项目级测量来研究这个问题。对于每个前缀后缀对,我们在空提示下和检索到的不同相关性上下文下,跨三个开放权重指令调整模型对目标后缀进行评分。我们发现上下文并不能简单地消除记忆。相反,可提取的记忆由上下文稳健的核心和上下文敏感的边界组成。许多无需上下文即可提取的样本在 检索上下文,特别是当前缀长度增加时。同时,上下文主要影响提取阈值附近的边缘样本:它抑制了一些暴露,但也启用了仅前缀评估错过的新样本。这些发现证实了 RAG 降低记忆风险的观点。上下文可以通过抑制边界情况来降低聚合提取,但稳健的可提取样本仍然存在,并且上下文支持的可提取性仍然与安全相关。