论文

Prototype Transformer:迈向设计上可解释的语言模型架构

Prototype Transformer: Towards Language Model Architectures Interpretable by Design

模型架构Transformer

摘要

虽然最先进的语言模型(LM)在某些领域超越了绝大多数人类,但它们的推理在很大程度上仍然不透明,破坏了对其输出的信任。此外,虽然自回归 LM 可以输出显式推理,但其真实推理过程是不透明的,这会带来欺骗和幻觉等风险。在这项工作中,我们介绍了原型变压器(ProtoT)——一种基于原型(参数向量)的自回归 LM 架构,作为标准自注意力变压器的替代方案。 ProtoT 通过输入序列和原型之间的双向通信来工作,我们表明这导致原型在训练期间自动捕获可命名的概念(例如“女人”)。它们提供了解释模型推理并允许对其行为进行有针对性的编辑的潜力。此外,通过设计,原型创建了沟通渠道,可以聚合不同时间尺度的上下文信息,从而有助于可解释性。在计算可扩展性方面,ProtoT 随序列长度线性扩展,而 SOTA 自注意力变换器的二次可扩展性则不同。与基线相比,ProtoT 可以很好地扩展模型和数据大小,并且在文本生成和下游任务 (GLUE) 上表现良好。 ProtoT 对输入扰动表现出与某些基线相当或更好的鲁棒性,但与它们不同的是,它提供了可解释的路径,显示鲁棒性和敏感性是如何产生的。 ProtoT 的性能接近最先进的架构,为创建可通过设计解释的性能良好的自回归 LM 铺平了道路。

Prototype Transformer:迈向设计上可解释的语言模型架构
图3:左:在第 0 层对原型 11 激活最强的序列,该原型编码了学术语境中的叙事概念。右:在第 4 层强烈激活原型 23 的某序列的写门(write-gate)、读门(read-gate)和记忆曲线。读门峰值先于写门激活出现,在恰好触发写门路由的 token 之前的那个 token 上出现尖峰。