论文

并非所有合成数据都可供您学习

Not All Synthetic Data Is Yours to Learn From

模型训练合成数据

摘要

语言模型能否在没有提示、没有老师、没有验证者、没有奖励模型的情况下,通过从自身采样的纯文本来改进?是的,但只有当合成语料库与学生兼容时,这是源-学生对的关系属性,而不是数据的内在属性。我们将其称为潜在能力重塑假设:弱自训练可以放大预训练模型中已经存在的能力,但前提是在这种兼容性条件下。我们在无提示无条件自我训练的最小设置中研究这一点,其中基本语言模型仅根据 BOS 词元生成的文本进行微调,没有任务规范或外部监督。我们报告了三项发现。首先,综合效用是相关的而不是内在的:自我生成的数据是最有效的来源,同系转移优于更强但训练不同的来源,而跨家庭转移则要弱得多。其次,常见的内在代理失败了:基准级别的语义相似性和学生下的平均每个标记的可能性都无法预测哪个语料库有帮助。第三,这种制度产生了令人惊讶的副产品。在受控的 Pythia 实验中,能力和逐字记忆解耦:基准实用性得到保留或改进,而保留的精确匹配提取下降了 95% 以上,并且没有忘记设置、隐私目标或有针对性的遗忘。总之,这些结果表明,无提示的自我训练是通过扩大学生已经知道的知识来发挥作用的,而不是通过从数据中导入结构来发挥作用。它们还揭示了一种机制,在这种机制中,能力和逐字记忆可以分开,而没有任何明确的遗忘目标。