论文
InferOpt:LLM推理配置的约束多目标搜索
InferOpt: Constrained Multi-Objective Search for LLM Inference Configurations
摘要
服务LLM意味着设置数十个推理时旋钮,从每层 KV 保留到每层专家计数。实践为它们设置了特定于机制的启发式方法,这些启发式方法返回单个操作点并且不会扩展到分层搜索空间。我们将推理配置重新构建为受约束的多目标黑盒优化,并构建了 InferOpt,这是一个仅需要变量边界、确定性资源成本和评估挂钩的可重用搜索框架。 InferOpt 在冻结采样代理集上进行搜索,在任何模型调用之前拒绝超出预算的候选者,自适应收紧预算,并在完整数据集上重新验证 Pareto 代表。一条管道覆盖28维连续KV空间(Qwen2.5-7B)和26维离散MoE空间(DeepSeek-V2-Lite)。在 KV 上,后预填充剪枝将 16K 缓存削减了 64.4%,TPOT 削减了 22.9--48.5%,并且 InferOpt 搜索的逐层预算比完整 KV 参考点的匹配统一预算高出 7.3% 和 14.0%。在 MoE 上,InferOpt 搜索的 top-k 计划删除了 43.0% 的路由token专家对,同时保持在默认值的 0.59 点以内,比匹配预算基线更接近。与随机搜索、NSGA-II 和 MOTPE 相比,InferOpt 在这两个领域均处于领先地位,在 KV 上采用最佳代理超体积和最低保留率,并在 MoE 最低专家处保持最接近未压缩参考。
