论文
平衡关系泛化和记忆的数学理论
A mathematical theory of balancing relational generalization and memorization
摘要
人类、动物和现代机器学习模型表现出令人印象深刻的学习复杂行为并将这些行为推广到未见过的情况的能力。这种能力要求我们学习允许这种泛化的规则和规律。同时,在最复杂的环境中,任何规则都会有例外。学习系统如何在学习一般规律和记忆例外之间取得平衡?我们认为,任务范式的缺乏阻碍了对这一基本能力的研究。为了解决这个差距,我们引入了一项新任务,即带有例外的传递推理,它测试关系泛化和关系规则例外的记忆。然后,我们分析了一个简单的、理论上易于处理的神经网络学习模型(核岭回归)在广泛的表示和任务参数中的行为。我们发现这些模型可以在关系泛化和记忆之间取得平衡,但与无一例外的传递推理不同,成功的泛化对特定的表征几何很敏感。我们利用我们的分析理论解释了为什么这项任务在机械上更具挑战性。最后,我们在对有序关系进行微调的预训练语言模型中验证了我们的理论见解,发现这些模型根据传递规则成功地进行了泛化,但也犯了我们的理论所预测的各种系统错误。总的来说,我们的理论展示了学习系统如何在关系泛化和记忆之间取得平衡,解释了这种情况是如何出错的,并强调需要设计新的任务范式来探索这种能力。