开源项目TensorRT-LLM:更新KV缓存管理与多模型推理支持NVIDIA/TensorRT-LLMNVIDIA·来源日期:2026.08.30AI 基础设施模型服务框架收藏概述TensorRT-LLM 是针对 NVIDIA GPU 的模型推理框架,提供模型执行与服务优化组件。 更新推理服务中的KV缓存管理与多模型支持。 本周更新围绕 KV 缓存管理和多类模型推理支持。KV 缓存保存生成时可复用的注意力状态,管理方式会影响显存占用及服务执行;本条不将组件变化直接换算为端到端加速。