开源项目dl-lowlat-infer:NVIDIA开源LSTM低延迟推理实现NVIDIA/dl-lowlat-inferNVIDIA·来源日期:2026.02.16模型推理推理加速收藏概述dl-lowlat-infer是NVIDIA开源的滑动窗口LSTM低延迟推理工程,基于CUDA实现,面向对推理时延敏感的流式场景。工程采用Apache-2.0许可,本次发布包含CUDA低延迟LSTM实现以及构建、测试和运行说明,部分文件经Git LFS分发,仓库内还带有面向编码代理的协作说明文件。需要在资源受限或实时设备上部署LSTM推理的工程师可据此复现。