论文

基于异构批处理的高效迭代检索

Efficient Iterative Retrieval with Heterogeneous Batching

AI 基础设施推理服务

摘要

现代信息检索日益同时使用嵌入模型与生成模型来处理复杂查询。然而,当前服务系统因孤立地执行这些模型而吞吐量低、GPU 利用率差。粗粒度切分(如把专用 GPU 分配给特定任务)无法适应动态负载,并产生计算气泡。为此,我们提出 Orthrus,一个在统一推理循环内执行异构批处理的服务系统。主要挑战在于统一计算模式相互冲突的嵌入与生成工作负载,同时优化批次组成以获得高性能。Orthrus 通过带增量池化的分块嵌入以及按负载感知方式调整批次组成来应对这些挑战。在四块 A100 GPU 上的评估显示,相对基线部署,Orthrus 在受控工作负载上取得 1.28 至 4.52 倍的更高吞吐,并在迭代 RAG 基准上将端到端 p99 延迟最多降低 55.8%。代码已发布,见原文链接。