数据高效语言建模的关系关注
Relational Attention for Data-Efficient Language Modeling
摘要
我们提出了 Relational BabyLM,这是一个提交给 BabyLM 2026 挑战的系统,它将两个认知驱动的归纳偏差结合在一个仅解码器的 Transformer 中。在架构上,我们用双注意力变换器(DAT)取代了标准的自注意力,它将对象级(“感觉”)词汇特征的路由与结构/关系信息分开(Altabaa和Lafferty,2025;Altabaa等人,2024;Webb等人,2024;Kerg等人,2022;Webb等人,2021)。与自注意力分离的关系注意力(RA)极大地提高了纯关系任务上的数据效率和训练样本外泛化能力,但语言建模需要将对象级和关系信息进行集成和分离,而基于 RA 的语言模型在很大程度上仍未得到探索。 BabyLM的数据约束训练和综合评估是数据效率是否迁移的理想试验场。作为训练干预,我们添加了下一个潜在预测(NextLat;Teoh 等人,2026)目标,该目标鼓励隐藏状态将历史增量压缩为密集的信念状态。结构是结构语言概括的主导因素;虽然目标是次要的,但仍然很重要。 DAT 的三种关系注意力类型(完整的 RA 与更简单的 RCA 和 DisRCA 变体)在 10M 字时基本上可以互换;完整的 RA 领先 100M。我们还引入了一种新颖的符号检索机制(基于 RoPE,而不是学习的相对符号),该机制可以在不添加参数的情况下匹配学习的符号库。在严格的(100M 字)赛道上,我们的最佳模型在 55 个整体中排名第 6,在撰写本文时在排行榜的 NLP 任务子集上排名 55 个中第 3;我们的两个最强模型在大多数基准测试中都优于 GPT-2 基线,其中一个模型在严格跟踪条目中获得了最高的 EWoK 分数。