论文
Mix-Quant:量化预填充,Agentic LLM 精确解码
Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs
摘要
LLM 代理最近已成为通过规划、工具使用、记忆检索和多步骤交互来解决复杂任务的强大范例。然而,这些代理工作流程通常会引入大量的输入端开销,使得计算密集型预填充阶段成为长上下文、多轮推理的关键瓶颈。在这项工作中,我们提出了 Mix-Quant,一种简单有效的相位感知量化框架,用于快速代理推理。我们首先研究代理 LLM 工作流程中的 FP4 量化,并观察到量化整个推理过程可能会导致性能显着下降。相比之下,预填充阶段表现出大量的量化冗余,因此可以以最小的精度损失进行量化,尽管它是计算的主要来源。基于这一见解,我们将高吞吐量 NVFP4 量化应用于预填充阶段,同时保留 BF16 解码精度。通过将预填充加速与解码质量解耦,Mix-Quant 将相位感知算法量化与硬件高效的 NVFP4 执行相结合,以缓解 LLM 代理中的推理瓶颈。跨长上下文和代理基准的大量实验表明,Mix-Quant 在很大程度上保留了任务性能,同时显着提高了效率,在预填充过程中实现了高达 3 倍的加速。