开源项目

TensorRT-LLM v1.3.0rc28:统一分离式服务 KV 传输契约

NVIDIA/TensorRT-LLM v1.3.0rc28

AI 基础设施推理服务

概述

TensorRT-LLM 是 NVIDIA 的模型推理优化与服务工具。分离式服务将预填充和解码放到不同计算节点,需要传输 KV 缓存。 TensorRT-LLM v1.3.0rc28 更新分离式服务的 KV 传输协调、准入与后端契约,并增加 Token 感知的 ADP 路由和 NIXL 传输缓冲支持。Llama、Llama4 默认启用 KV 缓存管理器 V2。 这是候选版本。已知问题涉及部分多节点启动、地址解析、特定缓存传输和模型配置,部署前应按实际拓扑检查。