论文

超越截断:将大模型解码重新理解为集成剪枝

Beyond Truncation: Rethinking LLM Decoding as Ensemble Pruning

模型推理解码与生成控制

摘要

我们提出马氏集成解码ME-Decoding,一种把候选token选择视为集成剪枝的大语言模型解码框架。现有选择策略主要依赖标量概率,忽视几何语义关系,造成候选冗余;当前几何感知方法往往需要复杂优化,或直接重加权原始token概率,带来显著计算开销或推理不稳定。为此,我们以马氏距离驱动目标将解码表述为子集优化问题,在保留高概率的同时增强语义多样性。具体而言,我们通过在token嵌入上采用自适应带宽核构建相似度矩阵,动态折减冗余生成路径。我们进一步设计高效贪心选择算法,在提前停止条件下对候选规模具有近线性复杂度,并建立理论近似保证。这使ME-Decoding成为推理开销可忽略的稳健即插即用模块。跨多种推理与生成任务的大量实验显示,该方法持续取得较强表现。

超越截断:将大模型解码重新理解为集成剪枝:论文配图
图6:开放式生成基准上的平均排名比较。热图展示各模型及温度设置下,每种解码方法在AlpacaEval和MT-Bench上的平均排名。