论文
使用解码约束波束搜索估计语言模型中的近逐字提取风险
Estimating near-verbatim extraction risk in language models with decoding-constrained beam search
摘要
最近的工作表明,用于量化 LLM 中的记忆的标准贪婪解码提取方法忽略了提取风险在序列之间的变化。概率提取——计算在解码方案下给定前缀生成目标后缀的概率——解决了这个问题,但仅适用于逐字记忆,缺少造成类似隐私和版权风险的近逐字实例。量化近逐字提取风险的成本很高:近逐字后缀集组合很大,可靠的蒙特卡罗 (MC) 估计可能需要每个序列约 100,000 个样本。为了减轻这种成本,我们引入了解码约束波束搜索,它以相当于每个序列约 20 个 MC 样本的成本产生近逐字提取风险的确定性下限。在实验中,我们的方法显示了逐字方法不可见的信息:更多的可提取序列、更大的每个序列提取质量,以及近逐字提取风险在模型大小和文本类型中表现的模式。