论文

VeriAttn:降低可验证LLM推理的通信开销

Communication-Efficient Verifiable Attention for LLM Inference

模型推理分布式推理

摘要

远程 大语言模型 (LLM) 服务的计算完整性可能存在问题。对于传统的深度神经网络(DNN),现有的 TEE 屏蔽 DNN 分区(TSDP)方法使用可信执行环境(TEE)来计算非线性组件并验证卸载到不可信 GPU 的线性组件的完整性。然而,直接将 TSDP 应用于基于 Transformer 的 LLM 会产生大量的 TEE 计算和 TEE-GPU 通信开销。本文提出了通信高效的 TEE-GPU Attention (\textsc{VeriAttn}),用于加速可验证的 LLM 推理。 \textsc{VeriAttn} 将注意力的线性和非线性计算卸载到 GPU,而 TEE 执行验证。此外,对于预填充,\textsc{VeriAttn} 使用两级管道来重叠数据移动、TEE 前/后处理和 GPU 计算。对于解码,当键值缓存超出可用 GPU 内存时,\textsc{VeriAttn} 会在 TEE 和 GPU 之间划分注意力,以减少重复的键值传输。在英特尔 TDX 平台上的评估表明,对于预填充和解码期间的 6k 词元提示和 10k 词元输出,\textsc{VeriAttn} 比 TSDP 分别实现了 2.60-3.38$\times$ 和 3.86-5.42$\times$ 加速。