论文

OneComp:生成式 AI 模型压缩的单行革命

OneComp: One-Line Revolution for Generative AI Model Compression

模型优化模型压缩

摘要

部署基础模型越来越受到内存占用、延迟和硬件成本的限制。 后训练 压缩可以通过降低模型参数的精度来缓解这些瓶颈,而不会显着降低性能;然而,当从业者在量化算法、精度预算、数据驱动的校准策略和依赖于硬件的执行机制的碎片化环境中导航时,其实际实施仍然具有挑战性。我们推出了 OneComp,这是一个开源压缩框架,可将专家工作流程转变为可重复的、资源自适应的管道。给定模型标识符和可用硬件,OneComp 会自动检查模型,规划混合精度分配,并执行渐进的量化阶段,范围从逐层压缩到逐块细化和全局细化。一个关键的架构选择是将第一个量化检查点视为可部署的枢轴,确保每个后续阶段都改进相同的模型,并且随着投入更多计算而提高质量。通过将最先进的压缩研究转化为可扩展、开源、硬件感知的管道,OneComp 弥合了算法创新和生产级模型部署之间的差距。