论文
语言扩散模型是能够检索未见过的数据的联想记忆
Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data
摘要
语言扩散模型何时记住其训练数据,以及如何定量评估其真实的生成机制?我们通过证明基于均匀的离散扩散模型(UDDM)从根本上表现为联想记忆(AM)$\textit{具有涌现的创造性能力}$来解决这些问题。 AM 的核心思想是通过在数据点周围建立不同的吸引力盆地,将存储的数据点可靠地恢复为 $\textit{memories}$。从历史上看,Hopfield 网络等模型使用显式能量函数来保证这些稳定的吸引子。我们通过利用能量并不是严格必要的观察来拓宽这一观点,因为吸引力盆地也可以通过条件似然最大化形成。通过评估 $\textit{training}$ 和 $\textit{test}$ 示例的标记恢复,我们在 UDDM 中发现了由训练数据集大小控制的急剧记忆到泛化转变:随着训练数据集大小的增加,训练示例周围的盆地缩小,而未见过的测试示例周围的盆地扩大,直到两者后来收敛到同一水平。至关重要的是,我们可以仅使用预测词元序列的条件熵来检测这种转变:记忆的特征是条件熵消失,而在泛化机制中,大多数词元的条件熵仍然是有限的。因此,条件熵为已部署模型中的记忆到泛化的转变提供了实用的探索。