论文

计算重要的地方:自我优化语言模型

Compute Where it Counts: Self Optimizing Language Models

模型推理测试时计算扩展

摘要

高效的 LLM 推理研究主要集中在降低每个解码步骤的成本(例如,使用量化、修剪或稀疏注意力),通常对每个生成的词元应用统一的计算预算。在实践中,词元难度差异很大,因此静态压缩可能会在简单步骤上计算过度,而在困难步骤上计算不足。我们研究自回归解码的动态预算分配:了解单个模型中每个词元要花费多少计算量。自优化语言模型 (SOL) 将冻结的 LLM 与轻量级策略网络配对,该网络读取 LLM 隐藏状态并在每个解码步骤选择离散效率操作。动作可以联合控制(i)词元级注意力稀疏性,(ii)MLP中的结构化激活修剪,以及(iii)激活量化位宽,同时保持基本模型权重不变。我们在教师强制的情节上使用组相对策略优化来训练策略:词元序列是固定的,同时我们对多个计算计划(即仅改变相同词元路径的效率操作的“反事实”计划)进行采样,并在相同的监督下比较它们的可能性。我们的奖励权衡了语言模型的质量和软处罚,鼓励剧集平均预算使用符合所要求的目标。在模型变体和计算机制中,SOL 比静态分配和强大的随机调度搜索在匹配预算的情况下提高了质量,为推理效率优化提供了补充轴。 SOL 在我们所有的实验中发现了更好的质量效率帕累托前沿,并将 MMLU 准确性比统一预算分配策略提高了 7.3%。