论文

LLM 的推理本机零阶优化

Inference-Native Zeroth-Order Optimization for LLMs

AI 基础设施推理服务

摘要

零阶 (ZO) 方法仅使用前向传递来训练 大语言模型,但常见的 ZO 执行路径执行的大量工作超出了算法本身的要求。为了消除这种额外的执行开销,我们提出了 Infer-ZO,它将算法所需的评估与其执行方式分开,从而允许它们重用现有的推理引擎优化。删除继承的执行工作后,Qwen3-14B 上的完整 Infer-ZO 步骤仅比匹配推理增加 1.16% 的挂钟时间,使 ZO 执行接近其基本推理工作负载。借助 Infer-ZO,ZO 评估可以以接近推理成本的速度运行,并具有冻结的基本权重,并且可以与普通推理请求共享 GPU 批次。在协同服务实验中,前台和后台吞吐量保持在相应后台请求基线的 1-3% 范围内。在 15 个 Qwen3、Llama 和 OPT 模型中,Infer-ZO 比已发布的 LoZO 实现了 2.10x-9.94x 的端到端步骤加速。代码可在 https://github.com/playeriv65/zo-vllm 获取。