论文
PhaseGate:Unified 记忆上设备上LLM的阶段感知 CPU 检索调度
PhaseGate: Phase-Aware CPU Retrieval Scheduling for On-Device LLMs on Unified Memory
摘要
设备上的助手在统一的记忆系统上运行基于 GPU 的LLM推理以及 CPU 检索。在饱和的本地检索工作负载下,四个并发检索工作线程在两个 M4 系统上将 95% (p95) 解码延迟提高了 60-61%,而预填充延迟仅提高了 5.7-6.9%。我们研究LLM阶段作为受控LLM工作负载下独立 CPU 检索的准入信号。 PHASEGATE 校准预填充和解码的单独并发限制,在我们的基础 M4 配置上选择四和一。在积压队列下,它的总检索吞吐量是经过最佳测试的可行固定策略的 2.0 倍,在所有 7 次留出运行中,p95 LLM延迟指标均在其无检索基线的 1.25 倍之内。相位盲控制 TimeGate 在校准导出的时间表上使用相同的两个限制,而无需观察LLM相位。它实现了类似的检索吞吐量,但在每次运行中违反了输出token延迟限制。 M2 和 M2 Pro Mac mini 重现了策略排序,而输出长度扫描表明,随着解码占用每个请求的更多内容,优势逐渐缩小。