论文

RATIO:量化推理模型的推理分析和标记级推理优化

RATIO: Reasoning Analysis and Token-level Inference Optimization for Quantized Reasoning Models

模型推理解码与生成控制

摘要

训练后量化 (PTQ) 已成为一种广泛采用的技术,用于减少大语言模型 (LLM) 的内存占用和推理成本。然而,最近的研究表明,当应用于推理模型时,PTQ 不仅会降低推理性能,还会加剧过度思考,导致推理轨迹更长。这些问题可能会抵消低精度推理所带来的预期效率提升。现有方法主要依赖于复杂的优化过程。最近的轻量级推理策略使用预定义的过度思考标记,限制了它们在量化模型中的适应性。为了解决这些问题,我们提出了推理分析和词元级推理优化(RATIO),这是一个框架,可以识别特定于模型的过度思考词元并为每个词元分配量身定制的惩罚。 RATIO 首先引入了量化感知推理行为分析 (QRBA),通过分析全精度模型和量化模型之间的差异来识别过度思考的标记。然后,它采用特定于词元的惩罚确定(TSPD),它利用全精度指导来得出特定于词元的惩罚,而无需额外的训练。大量实验表明,RATIO 比现有的词元级别干预措施实现了更好的准确性-效率权衡。具体而言,与量化基线相比,RATIO 的准确率提高了 9.8 个点,并将思维链 (CoT) 长度缩短了 51.3%。该代码可在 https://github.com/steven-bao1/RATIO. 获取