论文
Imprint Reader:从权重更新读出到行为干预
Imprint Reader: From Weight-Update Readout to Behavioral Intervention
摘要
随着语言模型在人工智能开发中发挥越来越大的作用,它们自然希望像人类一样反思自己的学习过程,并利用这种反思来提高自己。同时,这些模型具有人类学习者所缺乏的优势,因为训练留下的参数级痕迹原则上可以直接检查。然而,当前的模型无法将这些痕迹解码为它们所学到的内容的明确描述。为此,我们引入了 \textit{Imprint Reader},这是一个使用 \textit{语义安装和读取调整} (SaRT) 训练的模型,用于描述冻结权重更新。 SMaRT 将每个更新安装到阅读器上,并使用无锚元查询来引出自然语言描述,而无更改和随机扰动控制则阻止不受支持的声明。在保留的更新中,联合读者达到基于判断的 Pass@100,知识为 $2\%$,行为为 $16\%$。这些结果证明了自然语言读出的可行性,同时指出了下一步的更新可靠性。除了自由形式生成之外,Reader 还为指定目标行为和候选权重更新之间的差距提供了可微分代理。其坐标对齐渐变支持通过 MetaEdit 进行干预。在 0.5\%$ 修剪率下,读者引导选择在安全维护目标下将有害提示拒绝从 $57.9\%$ 提高到 $64.1\%$。使用没有目标任务训练数据的行为描述,MetaEdit 增加了数学推理轨迹中回溯和子目标表达的频率,并将 BFCL 总体从 $41.69\%$ 提高到 $44.60\%$。