论文

PIPO 联合输入压缩与多Token预测降低推理成本

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

模型推理模型架构新型架构解码与生成控制推理加速投机采样

摘要

长思维链推理使自回归解码成为现代大语言模型的主要推理成本。现有研究分别改进输入端的潜空间压缩,或输出端的投机解码及多Token预测(MTP),两条路线通常独立进行;输出端方法还需昂贵的验证前向计算,校验MTP预测的不可靠草稿Token。我们提出Pair-In, Pair-Out(PIPO),将潜空间压缩器和MTP头视为镜像操作:压缩器把两个输入Token折叠为一个潜在表示,MTP头则把一个隐藏状态展开,额外输出一个Token。为在不牺牲可靠性的前提下移除验证成本,PIPO训练轻量置信度头,判断是否接受草稿Token。我们发现同策略蒸馏(OPD)自然契合投机解码的拒绝采样准则,可在OPD训练时一并学习置信度头,几乎不增加开销。以Qwen3.5-4B及9B为骨干,在AIME 2025、GPQA-Diamond、LiveCodeBench v6和LongBench v2上,PIPO相较常规解码的pass@4最高提升7.15个百分点,首Token时延和每Token时延分别最高获得2.64倍及2.07倍加速。

PIPO 联合输入压缩与多Token预测降低推理成本:输入侧方法、输出侧方法与PIPO的比较。PIPO将潜在压缩器和多Token预测头视为主干两侧的镜像操作,并训练轻量置信度头,以替代推测解码中
图1:输入侧方法、输出侧方法与PIPO的比较。PIPO将潜在压缩器和多Token预测头视为主干两侧的镜像操作,并训练轻量置信度头,以替代推测解码中的验证器(如EAGLE)。