论文
PIPO 联合输入压缩与多Token预测降低推理成本
Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs
摘要
长思维链推理使自回归解码成为现代大语言模型的主要推理成本。现有研究分别改进输入端的潜空间压缩,或输出端的投机解码及多Token预测(MTP),两条路线通常独立进行;输出端方法还需昂贵的验证前向计算,校验MTP预测的不可靠草稿Token。我们提出Pair-In, Pair-Out(PIPO),将潜空间压缩器和MTP头视为镜像操作:压缩器把两个输入Token折叠为一个潜在表示,MTP头则把一个隐藏状态展开,额外输出一个Token。为在不牺牲可靠性的前提下移除验证成本,PIPO训练轻量置信度头,判断是否接受草稿Token。我们发现同策略蒸馏(OPD)自然契合投机解码的拒绝采样准则,可在OPD训练时一并学习置信度头,几乎不增加开销。以Qwen3.5-4B及9B为骨干,在AIME 2025、GPQA-Diamond、LiveCodeBench v6和LongBench v2上,PIPO相较常规解码的pass@4最高提升7.15个百分点,首Token时延和每Token时延分别最高获得2.64倍及2.07倍加速。
