论文

大语言模型 中基于超网络的知识注入的缩放定律

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

模型训练模型编辑与遗忘

摘要

将事实知识可靠且大规模地注入 大语言模型 (LLM) 仍然是一个开放的挑战。超网络为大规模知识注入提供了一种有前景的解决方案。虽然超网络通常用于测试时适应,但我们探索了它们在训练时知识注入中的使用,在给定大量事实的情况下,我们训练超网络来生成固定的 LoRA 适配器,当插入到目标模型中时,使模型能够回答有关这些事实的问题。在这项工作中,我们研究超网络是否可用于执行训练时知识注入以及这种能力如何随规模变化。超网络的扩展行为在很大程度上仍未得到研究。我们的设计将超网络的注入能力与目标模型的一般能力分离,首次实现了对超网络架构的扩展定律的严格研究。我们描述了损失、推理准确性和分布外(OOD)泛化如何随超网络深度、宽度和目标网络大小变化的情况。我们构建了一个名为 MegaWikiQA 的大型数据集,其中包含根据 Wikidata5M 中的示例构建的跨 39 个领域的数千万个多跳问答示例。我们的结果表明:(i)基于超网络的注入在所有架构轴上表现出广泛的预测幂律缩放; (ii) 超网络能够在不断增加的规模上进行可靠的 OOD 泛化,这表明超网络为其他训练时间适应方法(例如 LoRA 微调和完整的 微调)提供了一种有前途的替代方法,在所有 OOD 评估中表现出更陡峭的缩放指数。总之,这些结果将超网络确立为训练时间适应的有原则且可扩展的基础,并提供第一个基于经验的缩放定律来指导超网络进行 大语言模型 中的事实推理。