论文

数据稀缺下Transformer的工作记忆约束支架学习

Working Memory Constraints Scaffold Learning in Transformers under Data Scarcity

模型架构Transformer

摘要

我们研究了将类人工作记忆约束集成到 Transformer 架构中,并实现了几种受认知启发的注意力变体,包括基于固定宽度窗口和基于时间衰减的注意力机制。我们修改后的 GPT-2 模型是在发展合理的数据集(10M 和 100M 单词)上从头开始训练的。性能根据语法判断任务 (BLiMP) 以及与人类阅读时间数据的一致性进行评估。我们的结果表明,这些认知启发的约束,特别是固定宽度的注意力,可以显着提高语法准确性,尤其是在训练数据稀缺的情况下。这些受限模型也往往与人类处理指标表现出更强的一致性。研究结果表明,此类约束可能会起到有益的归纳偏差的作用,引导模型走向更稳健的语言表示,尤其是在数据有限的环境中。