论文

Agent-X:端侧智能体全流程加速

Agent-X: Full Pipeline Acceleration of On-device AI Agents

模型推理推理加速

摘要

基于LLM的智能体在各类任务上提供最先进的性能,但在边缘设备上端到端延迟很高。我们提出Agent-X,一个纯软件、不损失精度的框架,可加速端侧智能体工作负载的prefill和decode两个阶段。Agent-X的两个关键组件分别重写提示词以利用针对智能体特定输入词元模式定制的前缀缓存,以及启用无需LLM的推测解码,以极小开销实现快速词元生成。在代表性智能体工作负载上,Agent-X在真实系统中实现1.61倍端到端加速且无精度损失,并可无缝集成到现有端侧AI智能体中。据我们所知,这是首个系统性刻画并消除端侧智能体延迟瓶颈的工作。

Agent-X:端侧AI智能体的全流程加速:论文配图
图1:智能体系统总览,对应Agent-X的端侧AI智能体全流水线加速框架。