论文
顺序编码:利用自行生成的训练数据突破模型压缩的极限
Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data
摘要
压缩是智能的基础。可以将其训练数据表示为短代码的模型已经发现了能够进行泛化的规律。大型神经网络学习的函数可能比其参数计数所显示的简单得多,但构建实现这种简单性的代码具有挑战性。基于参数的方法(例如量化)产生的代码长度随模型大小而变化,对参数存储的信息量不敏感。前置编码通过压缩训练轨迹来绕过这个问题,但无论模型学习多少,都会对精确的数据序列进行编码,当数据具有高熵时会产生大代码。我们引入了顺序编码,其中教师模型从学生自己的分布中选择训练样本。学生的代码仅记录这些选择,仅在教师和学生不同意时才花费比特。生成的代码长度与参数计数和数据熵无关,并且通常比相应的前序代码短几个数量级,其优势随着规模的扩大而增长。这种压缩揭示了现有压缩机无法实现的现象。保持损失固定,尽管参数更多,但较大的模型和集成会压缩到更小的尺寸。插入 PAC-Bayes 边界后,请求代码可为十亿参数 LLM 提供最先进的泛化保证,甚至优于基于积极的 后训练 量化构建的边界,甚至允许零误差。随着模型相对于数据集大小变得越来越可压缩,在计算最优状态下,界限随着规模的增加而收紧。相同的代码预测模型在经过多个时期的训练时会逐渐过度拟合。它还将数据集中的可学习信息与其不可预测的随机内容隔离开来,揭示出较低熵文本比较高熵图像数据拥有更多可学习结构。