论文

推理拍卖

Inference Auctions

AI 基础设施推理服务

摘要

当推理需求超过可用计算能力时,模型提供者必须决定首先满足哪些请求。用户对 LLM API 的延迟容忍度不同,但当前的优先定价方案将这些差异压缩为粗略的固定价格服务等级。我们设计了一个推理拍卖,允许用户竞标以获得更快的服务。我们的拍卖以经济有效的方式分配优先级,而不牺牲延迟,并且我们开发了快速算法来实施激励真实投标的价格。我们还为推理拍卖设计了一个自动竞价Agent,其中用户指定推理预算,自动竞价者会随着时间的推移动态调整其出价,以在预算约束下最大化用户效用。实验验证了我们拍卖的实用性:它提高了系统福利,同时保持了 SGLang(一种最先进的推理服务框架)的缓存利用率和延迟优势。