论文
执行状态胶囊:用于低延迟、小批量、设备上物理 AI 服务的图形绑定执行状态检查点和恢复
Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving
摘要
主流LLM服务系统主要通过分页或基数键值(KV)缓存来重用前缀工作。这对于高吞吐量、高并发服务非常有效,但它只管理执行状态的一个位置片段:KV 缓存。我们研究相反的机制:低延迟、小批量、设备上的物理人工智能服务,其中交互式 LLM 代理、语音系统和机器人策略在紧张的响应预算下重复分支、重置、中断和重新进入。我们引入了执行状态胶囊、图形绑定检查点和恢复机制,用于在提交的边界处实现完整的可恢复状态。 FlashRT 是一个白盒、面向后端的内核运行时,其评估的 NVIDIA CUDA 后端在连续的静态缓冲区上运行捕获的图形计划,没有块表间接。因为活动状态是一组封闭的命名缓冲区,所以胶囊可以快照、恢复、分叉或回滚整个执行边界,包括 KV、循环状态、卷积状态、MTP 状态和元数据。这将重用从词元寻址的 KV 片段转移到图形绑定的执行状态边界。在 RTX 5090 上,胶囊恢复在存储状态级别是字节精确的,并且在贪婪解码下是词元相同的。仅 KV 消融发散,表明复发状态是承重状态。 GPU 驻留快照和恢复时间为亚毫秒级,TTFT 相对于冷预填充的加速从 2k 词元时的 3.9 倍增长到 16k 词元时的 27 倍。在 Jetson AGX Thor 和 DGX Spark 上,具有相同的正确性和结构属性。胶囊不能替代高吞吐量的 KV 缓存服务;它们定义了一个互补的延迟优先服务点,用于显式执行状态重用。