论文

CSR:具有海量缓存状态表示的无限视野实时策略

CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations

模型推理KV Cache

摘要

部署大规模 大语言模型 (LLM) 作为机器人的连续认知引擎会受到处理大量状态历史所需的首次词元时间 (TTFT) 延迟的瓶颈。 RAG 或滑动窗口等现有解决方案会损害全局上下文或产生过高的重新计算成本。我们形式化了最小化延迟的最佳任务结构,并从理论上证明了前缀稳定性、增量可扩展性和异步状态协调是实时性能的必要条件。基于这些证明,我们引入了缓存状态表示(CSR)框架作为这些属性的实际实例,确保最佳的 KV 缓存重用。为了在无限范围内维持这些属性,我们进一步提出了一种异步状态协调(ASR)算法,该算法将状态内存逐出卸载到并行计算资源,以消除延迟峰值。在无线连接到本地 GPU 服务器的物理机器人上,与标准基线相比,CSR 使用 235B 参数模型将 120K 词元上下文的延迟减少了 26 倍(14.67 秒至 0.56 秒)。在具体的 AI 基准上,我们实现了 SOTA 召回率(0.836 与 0.459),同时保持 RAG 级延迟。经验证,ASR 在连续的实际操作中可在 10 个驱逐周期内维持有界、无尖峰的 TTFT。 CSR 和 ASR 共同使大量 LLM 能够充当持续运行的高频(> 2 Hz)具体策略。