论文
为 LLM 推理实现高性能且灵活的模型内部可观察性
Enabling Performant and Flexible Model-Internal Observability for LLM Inference
摘要
当今的推理时间工作负载越来越依赖于及时访问模型的内部状态。我们提出了 DMI-Lib,一种高速深度模型检查器,它将内部可观察性视为一流的系统原语,通过由 Ring^2 构建的异步可观察性基底、用于捕获和暂存张量的 GPU-CPU 内存抽象以及导出张量的策略控制主机后端,将其与推理热路径解耦。 DMI-Lib 能够在丰富的内部信号空间和多样化的推理后端中放置观察点,同时保持服务优化并遵守紧张的 GPU 内存预算。我们的实验表明,DMI-Lib 在离线批量推理中仅产生 0.4%--6.8% 的开销,在中等在线服务中平均产生 6% 的开销,与具有类似可观测性特征的现有基线相比,延迟开销减少了 2-15 倍。 DMI-Lib 在 https://github.com/ProjectDMX/DMI 上开源。