论文

概念分配区:跟踪概念如何在 Transformer 深度中形成

The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth

模型评测模型行为与机制分析

摘要

Transformer 语言模型中的概念形成是一个深度扩展的过程,而不是单层事件:一个概念在残差流的一个或多个连续区域(其概念分配区(CAZ))中变得可分离。 CAZ 不是一个概念,而是深度段,模型在其中组织其几何形状以使一个可分离 - 概念可以共享一个 CAZ,并且通常跨越多个深度;配套的 GEM 论文显示,分离方向在稳定通过其边界之前继续在 CAZ 内旋转。我们通过三个分层指标(分离度、概念连贯性和概念速度)对 CAZ 进行形式化,并使用自动边界检测对 CAZ 成员资格不应用显着性阈值(每个片段都是 CAZ;“强”与“温和”是分数,而不是二元分割)。跨 35 个模型、8 个架构系列和 7 个概念的经验验证表明,分离曲线 S(l) 通常是多峰的,并且评分检测表面了标准峰值检测不可见的另一类微妙分配区域(“温和 CAZ”)。该框架生成七个可测试的预测;它的贡献是仪器及其表面的现象 - 评分探测器、三个指标和多模态/温和 CAZ 结果 - 而不是预测本身。作为开源 Rosetta_tools 库发布 (v1.3.1)。