论文
认知范畴Transformer:面向语言建模的范畴论归纳偏置
The Cognitive Categorical Transformer: Category-Theoretic Inductive Biases for Language Modeling
摘要
认知范畴Transformer(CCT)是一个306M参数的架构,它在预训练的GPT-2 Small骨干上增广了源自范畴论并从认知科学获得若干启发的、具有认知依据的组件。在WikiText-103上采用匹配步数协议(215,000个优化器步数、相同数据、相同优化器与调度)时,CCT达到21.27的验证困惑度,而同样微调的GPT-2 Small基线为24.19。因此,在仅靠领域内微调所能提供的改善之外,该架构额外贡献了2.92 PPL(相对12%)的降低。一项从头重训的消融实验——在整个七阶段激活日程中让GT-Full单纯形消息传递始终被绕过——达到23.72 PPL,将架构改进的84%(2.92 PPL中的2.45)定位于GT-Full。我们给出了首个经消融验证的证据,表明单纯形消息传递能在306M参数规模上改善WikiText-103上的语言模型困惑度。已发表的GPT-2 Large以比GPT-2 Small多6.2倍的参数在WikiText-103上达到22.05的零样本PPL;本文将该数字视为外部已发表参考值,而非架构基准。三项关于一致性式范畴先验(sheaf平滑、伴随往返、曲率正则化)的负面结果,加上GT-Full与PrecisionWeightedPP的联合结构先验结果,共同支持了一种被称为“结构/一致性区分”的经验模式:增加新拓扑的范畴先验能改善语言建模,而强制一致性恒等式的先验则不能。