论文

通过进程边车可撤销的学习状态

Revocable Learned State via Process Sidecars

模型训练模型编辑与遗忘

摘要

语言模型通常分阶段进行调整:公共技能阶段、私有记忆阶段和后来的安全阶段,该阶段学习拒绝与记忆实体相关的输出。在安全阶段之后撤销内存与减去内存更新不是同一个问题:后面的安全优化器已经传输了内存方向。我们引入了进程边车,一个二系数编辑族 $\hatθ(λ,γ)=θ_{\mathrm{AMS}}-λΔ_{\mathrm{M}}-γ\hat{R}_{\mathrm{S}\leftarrow\mathrm{M}}$,其中$\hat{R}_{\mathrm{S}\leftarrow\mathrm{M}}=\hat{J}_{\mathrm{S},\varepsilon}(Δ_{\mathrm{M}})-Δ_{\mathrm{M}}$,其中$\hat{J}_{\mathrm{S},\varepsilon}$是通过已实现的未来 AdamW 的中心割线安全训练过程。该实现在自然内存编辑范围内使用 $\varepsilon=1$ ;它重用 $θ_{\mathrm{AMS}}$ 作为正端点,并在 $θ_{\mathrm{A}}-Δ_{\mathrm{M}}$ 处计算一条额外的安全迹线。我们证明两件事。首先,精确的 sidecar 在 $(λ,γ)=(1,1)$ 处使用真实传输方向 $R_{\mathrm{S}\leftarrow\mathrm{M}}$ 而不是割线估计,将反事实的仅安全预言 $θ_{\mathrm{AS}}$ 恢复到二阶;证明将 AdamW 视为参数、一阶矩和二阶矩的增强状态映射。其次,这个过程信息是必要的:每当未来的安全训练改变记忆方向时,每个标量任务算术编辑都会留下一阶反事实错误,而过程边车编辑则是二阶准确的。在三个模型中,在所有试验中,验证选择的 2D 编辑都比朴素任务算术改进了保留的拒绝闭合,并且在所有配对试验中,在 $γ=λ$ process-JVP 子族(缓存的 2D 网格的对角线切片)上改进了保留拒绝闭合。