论文

xMIx:面向机制可解释性应用的高性能服务时平台

xMIx: High-Performance Serving-Time Platform for Mechanistic Interpretability Apps

AI 基础设施模型服务框架

摘要

机制可解释性(MI)已成为分析和干预推理计算的强大方法,应用日益增多,如越狱企图检测、真实性评估和幻觉检测。遗憾的是,MI 目前在生产级模型服务系统中的部署并不实际,因为大多数现有 MI 框架引入了高得令人却步的运行时开销。根本问题在于 MI 函数与服务中的模型无法干净地组合:它们割裂部署,常常迫使排空请求并重建服务状态,并与连续批处理和 CUDA-graph 执行等对生产部署至关重要的性能优化相冲突。我们提出 xMIx,一个用于在生产推理服务环境中部署 MI 应用的服务原生框架。xMIx 支持将 MI 函数挂载到模型运行时中预定义的一组位置,对层内和残差流中的激活进行插桩。xMIx 支持依据前面模型层的输出条件化调用 MI 函数。多个 MI 应用可以部署在单个模型实例中。xMIx 将它们全部编译进服务路径,但在运行时仅按需动态激活,性能代价可忽略,且不需要单独的模型实例或替代执行栈。我们将 xMIx 与 vLLM 服务系统集成,并在三个主要模型和七个多样的 MI 应用上进行评估。xMIx 达到与原生 vLLM 执行相当的性能,平均 token 间延迟(ITL)仅增加 1.3%,尾部 P99 ITL 增加 1.2%,平均首 token 时间(TTFT)增加 2.6%,平均总 token 吞吐(TTT)增加 1.6%。

xMIx:面向机制可解释性应用的高性能服务时平台:论文配图
图 1:xMIx 概述。 MI 函数可以安装(附加)在不同的转换器层和层内的多个位点(挂钩)中,并且可以读取/写入相应的激活和剩余流。在每个位置,可以动态启用/禁用一个功能,从而可以轻松实现常见的 MI 原语,并在单个模型部署中无缝切换不同的 MI 功能。图中,L16 层的激活基于 L1 之后激活的处理(读取)进行修改(条件写入)。