论文

探究表格​​情境学习的记忆

Probing Memorization of Tabular In-Context Learning

模型评测模型行为与机制分析

摘要

大型表格模型(LTM),即利用上下文学习(ICL)的表格基础模型,在表格任务上实现了最先进的性能。虽然已知 LLM 会无意中记住训练数据,但 LTM 的记忆动态在很大程度上仍未被探索。我们研究了表格 ICL 参数记忆的潜力。我们引入了 ICLMEM,这是一个探测框架,旨在将基于上下文的预测与参数记忆分开。我们的零信息多项选择上下文剥夺了有效的上下文模式,迫使模型退回到其参数记忆。我们受控的 微调 设置建立了 真值 成员资格,并解决了常见的陷阱,例如分布偏移、特征污染、基本率谬误,并且预训练的基本模型充当校准样本难度的参考。我们对领先的真实世界训练的 LTM 进行的受控评估在 10 个任务中的 8 个中检测到中等记忆信号($\text{AUC}$ 高达 $0.67$,TPR 为 $1\%$ FPR $>0.1$)。值得注意的是,对于低基数和二进制任务,记忆信号最强。然而,它们在现实训练条件下基本上消失了。我们的研究结果显示了特定情况下的 LTM 记忆信号(单任务 微调,跨多个时期的固定样本和较小的查询大小)。为了保护敏感数据,必须采取适当的措施,我们对此进行了讨论。