开源项目

TensorRT-LLM:更新KV缓存管理与多模型推理支持

NVIDIA/TensorRT-LLM

AI 基础设施模型服务框架

概述

TensorRT-LLM 是针对 NVIDIA GPU 的模型推理框架,提供模型执行与服务优化组件。 更新推理服务中的KV缓存管理与多模型支持。 本周更新围绕 KV 缓存管理和多类模型推理支持。KV 缓存保存生成时可复用的注意力状态,管理方式会影响显存占用及服务执行;本条不将组件变化直接换算为端到端加速。