论文

OmniTide:协同设计算法与系统以改善设备端Omni-LLM流式服务

OmniTide: Co-Designing Algorithms and Systems for Efficient On-Device Omni-LLM Streaming

模型优化端侧模型

摘要

设备上的流式全模态推理可保护用户隐私并消除令人望而却步的每个词元 API 成本,但面临一个关键瓶颈:多模态数据的持续涌入通过单调的 KV 缓存增长迅速耗尽有限的内存和计算预算。现有的稀疏注意力方法存在不足,要么导致令人望而却步的在线估计延迟,要么破坏交错的跨模式上下文,同时无法解决物理内存碎片问题。我们引入了 OmniTide,这是第一个专为高效的设备上流式全模态推理而定制的算法系统协同设计。在模态感知结构稀疏性的观察驱动下,OmniTide 采用了基于单元的抽象,该抽象包含两个组件:(1)在算法层面,OmniPick 在逻辑上保留基于单元边界和模态重要性的关键多模态上下文,以保持任务准确性; (2) 在系统级别,OmniPage 根据保留可能性对缓存进行物理分区,并动态压缩幸存的稀疏词元,从而最大限度地减少内存碎片和数据移动开销。对三个流媒体基准测试和两个消费设备架构的广泛评估表明,OmniTide 实现了高达 12.72 美元的内核加速,并将流循环延迟降低了 2.40 美元。在 StreamingBench 上,在相当的会话成本下,它的准确度比滑动窗口基线提高了 18.0 个百分点。相对于本机逻辑驱逐,OmniPage 进一步将物理 KV 跨度减少了高达 26.7%,从而解锁了边缘设备上的实时、无限上下文流。