论文

使用 推测解码 加速 PayPal 商务代理:使用微调 Nemotron 模型对 EAGLE3 进行实证研究

Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models

模型推理投机采样

摘要

我们使用 EAGLE3 评估 推测解码 作为 PayPal 商务代理的推理时间优化,由微调的 llama3.1-nemotron-nano-8B-v1 模型提供支持。基于之前通过特定领域的 微调 降低延迟和成本的工作 (NEMO-4-PAYPAL),我们在相同的 2xH100 硬件上通过 vLLM 对 EAGLE3 与 NVIDIA NIM 进行基准测试,跨 40 个配置,涵盖推测词元计数 (gamma=3、gamma=5)、并发级别 (1-32) 和采样温度 (0, 0.5)。主要发现:(1) gamma=3 在零额外硬件成本的情况下实现了 22-49% 的吞吐量提升和 18-33% 的延迟减少; (2) 在所有条件下,gamma=3 的接受率保持稳定在约 35.5%; (3) gamma=5 产生收益递减(约 25% 的接受率); (4) LLM-as-Judge 评估确认完全保留了输出质量; (5) 单个 H100 上的 推测解码 与两个 H100 上的 NIM 相当或超过,从而使 GPU 成本降低 50%。