论文

AI印记:寻找人工智能中的记忆痕迹

AI Engram: In Search of Memory Traces in Artificial Intelligence

模型评测模型行为与机制分析

摘要

记忆形成是智力的基础,但深层神经网络是否保留类似于生物记忆单元的可识别记忆痕迹仍然是一个悬而未决的问题。这项工作引入了一个几何框架,通过将特异性、重新激活、充分性和必要性的神经科学标准形式化为受约束的逆问题来识别此类“人工智能印迹”。我们推导了一个封闭形式的估计器,它将个体记忆痕迹与全局纠缠参数隔离开来,并表明这种生物衍生的解决方案对应于参数流形上的自然梯度更新。人工智能印迹可以对学到的知识进行外科手术操作:任何记忆子集都可以通过线性算术组成或删除,无需迭代优化。从简单的 MLP 到 LLM 的实验证明了人工智能印迹的因果有效性和显着的可扩展性。总之,这些结果将生物记忆和人工表示学习理论联系起来,并提供了关于深度网络如何同时支持分布式存储中的功能特异性的几何见解。

AI印记:寻找人工智能中的记忆痕迹:论文配图
图 1:AI 印迹的神经科学标准图示。目标概念 cc 的印迹 𝝁c+\bm{\mu}_{c}^{+} 被识别为满足以下条件的因果底物: i) 特异性:相对于参考 𝑿c−\bm{X}_{c}^{-} 选择性编码目标体验 𝑿c+\bm{X}_{c}^{+}; ii) 重新激活:学习到的内部表征的一致再现𝒁c+\bm{Z}_{c}^{+}; iii) 充分性:通过将 𝝁c+\bm{\mu}_{c}^{+} 注入空状态 𝝁null\bm{\mu}_{\text{null}} 来诱导内存; iv) 必要性:通过手术从学习状态 𝝁all\bm{\mu}_{\text{all}} 中消融 𝝁c+\bm{\mu}_{c}^{+} 来消除记忆。