前馈层中的显式模糊逻辑:自忘量词发现清晰的语法许可检测器
Explicit Fuzzy Logic in the Feed-Forward Layer: Self-Forgetting Quantifiers Discover Legible Grammatical-Licensing Detectors
摘要
Transformer 的前馈 (FFN) 子层具体化了注意力收集的差异,但没有考虑它计算的内容。在参数中性替换中,每个隐藏单元都是 sigmoid 有界 [0,1] 成员资格上的显式模糊集运算:交集 A*B 和集合差 A*(1-B),后者是门控/双线性单元所缺乏的有界正负(“A 但不是 B”)——可求反的 FFN (NC-FFN)。在 N 位奇偶校验上,它们是浅层深度最有效的参数推理基础;规模(125M,OpenWebText)NC-FFN 将 GELU 基线的复杂性联系在一起,每个单元都带有明确的逻辑形式。两个限制有一个共同原因:双操作数逻辑定位于第 0 层并在训练中受到侵蚀,而一个强大的语法缺陷集中在许可和量词上,超出了词元内运算符的范围。我们用一小块序列量词来解决这两个问题:一个软存在量词和一个软比例量词,每个量词都有一个从粘性初始化中学习到的每个单元的遗忘率。这弥补了第一个时期的赤字(将更广泛的第二个时期差距减半),适度领先于 LAMBADA,并使 FFN 清晰可见:该结构现在保持并迁移到深度;衰变会忘记它的粘性(半衰期中值 ~1.5 个词元;零锁存单元);在语义层,这些单元在没有字典学习的情况下作为语法许可检测器进行读取:每个单元都会触发一个许可者(比较级、被动分词、负极性项目)并向前推进其记忆以预测许可词(than、by、nor)。这种易读性是本地化的,并且仅在分区范围内是自由的(完全布尔型 FFN 在训练中发散),但结果是参数中立、语言模型质量的 Transformer ,具有可读的、可按构造解释的语法机制——不仅说明前馈层表示什么,还说明它如何许可。