论文
MarginGate:批量不变 LLM 推理的稀疏保证金触发验证
MarginGate: Sparse Margin-Triggered Verification for Batch-Invariant LLM Inference
摘要
零温度 BF16 LLM 推理通常被视为可重现,但相同的请求在单独解码或在较大批次内解码时可能会发出不同的词元。现有修复使用批次不变运算符或 LLM-42 的每个词元验证,即使大多数步骤稳定也会产生成本。我们询问验证是否可以专门应用于翻转的词元。在五个模型中,批量引发的词元翻转在翻转率基准上是稀疏的:在 MATH500 上,Llama-3.1-8B 在同步解码步骤 $0.48\%$ 上翻转,所有测试模型在 MATH500、GSM8K 和 HumanEval 上都保持在 0.3-1.3% 的范围内。 K/V 扰动在翻转之前保持平稳,而低 top-1/top-2 logits 间隔暴露了大部分翻转风险。 MarginGate 将这些观察结果转化为验证者策略:它在高间隔步骤上保持 BF16 解码,仅验证低间隔步骤,并通过替换当前的 K/V 列来修复已确认的不匹配。我们对四个数据集进行评估,在 MATH500 上进行校准并转移到 GSM8K、SharedGPT 和 HumanEval。 MarginGate 在 Llama-3.1-8B 和 Qwen2.5-14B 上恢复 100% 序列级确定性解码,验证器触发率为 18.56%/15.05%,相对于始终在线验证,将 LLM-42 的延迟增量减少 2.23 倍/1.99 倍。在 DSR1-Distill-Qwen-7B 上,相同的策略在更严格的机制中以 49.50% 的触发率达到了确定性。