论文
AIPC:使用 Qualcomm AI Runtime 进行基于代理的 AI 模型部署自动化
AIPC: Agent-Based Automation for AI Model Deployment with Qualcomm AI Runtime
摘要
边缘AI模型部署是一个多阶段的工程过程,涉及模型转换、算子兼容性处理、量化校准、运行时集成和精度验证。实际上,此工作流程很长、容易失败,并且严重依赖于部署专业知识,特别是在针对特定于硬件的推理运行时时。本技术报告介绍了 AIPC(AI 移植转换),这是一种 AI 代理驱动的方法,用于限制 AI 模型部署的自动化。 AIPC 将部署分解为标准化、可验证的阶段,并通过代理技能、帮助程序脚本和分阶段验证循环将部署领域知识注入代理执行中。这种设计减少了硬件部署所需的专业知识障碍和工程时间。本报告以 Qualcomm AI Runtime (QAIRT) 作为主要场景,研究了跨代表性视觉、多模态和语音模型的自动化部署。在此处介绍的案例中,AIPC 可以在 7-20 分钟内完成从 PyTorch 到可运行的 QNN/SNPE 推理的部署,用于结构常规视觉模型,指示性 API 成本大致在 0.7-10 美元范围内。对于涉及较少支持的算子、动态形状或自回归解码结构的更复杂的模型,完全自动化的部署可能仍需要进一步的进步,但 AIPC 已经为执行、故障定位和有界修复提供了实际支持。