论文

训练、阅读和编辑清晰的 Transformer

Training, Reading, and Editing Legible Transformers

模型架构Transformer

摘要

Transformer 可以由通过构造清晰的运算符构建 - 有界的命名单元,读作模糊集运算而不是密集激活 - 但在训练过程中必须强调易读性,并且压力具有失败模式。脆度惩罚旨在将有界算子锐化为决定性的检测器,而不是将其压缩为死常数。恒等式 E[v(1-v)] = mu(1-mu) - var 说明了原因——惩罚是方差最小化器,对实时检测器和常量之间的差异视而不见——并命名了修复方案:每通道方差下限,将目标易读性度量写为损失,从而恢复易读性和质量。然后,学习到的每单元分数将淘汰之前工作中的手持设备保留 GELU 分区:如果选择模型,则模型不会将任何单元保留为纯 GELU,并通过清晰的算子路由 87% 的负载计算。结果是我们构建的最清晰的 Transformer —— 78% 的前馈操作数和 50% 的注意力值通道是清晰且上下文相关的检测器,每个头的易读性从浅层的 18% 上升到深层的 78%。读入正确旋转的每层帧,这些单元将干净的检测(单元响应的内容)与更难的命名(其输出解码的内容)分开;由于目标使每个单元变得清晰和稀疏,因此对它们的编辑更加局部化——在编辑位点集中的深层中实现 50-184 倍——并且可以针对单个神经元无法表达的显式连词。最后,单元间去相关压力暴露了一个易读性刻度盘:它以电路的重用换取独立性,而无需质量成本,将概念转变为单一的、可手术编辑的单元,并将预测转变为读出少数命名操作的简短解释。质量始终保持与传统基线相同。