从人类指导到自主:空间 NPU 上端到端 LLM 部署的代理技能系统
From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs
摘要
空间神经处理单元 (NPU) 为边缘 LLM 推理提供了一个节能平台,但在此类硬件上高效地端到端部署 LLM 仍然是劳动密集型的。尽管AI 编码智能体已经开始降低这一成本,但现有的研究主要集中在单内核优化上,而不是资源受限的空间NPU上的端到端LLM部署。我们提出了一种在 AMD XDNA 2 NPU 上实例化的两阶段方法,该方法从人工引导开发发展到代理自主。在第一阶段,我们通过人工指导代理协助开发 Llama-3.2-1B 的参考部署。与手动优化的基线相比,最终的实现在预填充方面实现了 2.2 倍的加速,在解码方面实现了 4.0 倍的加速,并将优化轨迹及其经验教训记录为结构化文档。在第二阶段,我们将文档提炼成由八个阶段组成的代理技能系统,编排优化和调试技能集,并在每个阶段严格执行数值正确性。使用我们的代理技能系统,我们使用开源编译器堆栈在 AMD XDNA 2 NPU 上端到端自主部署八个额外的仅解码器 LLM(Llama-3.2-3B、SmolLM2-1.7B、Qwen2.5-{0.5B, 1.5B, 3B}、Qwen3-{0.6B, 1.7B, 4B})。据我们所知,这些模型之前尚未通过任何开源软件堆栈部署在 AMD NPU 上。每个部署在几乎没有人工指导的情况下在 0.5-4 小时的代理墙上时间内完成,并通过数字正确性门,展示了对以前未遇到的 LLM 的功能泛化。八个中的三个匹配或超过我们的 Llama-3.2-1B 参考部署的持续性能,这表明最终的实现无需额外的特定于模型的人体工程即可具有竞争力。