从 PyTorch 到 NPU:跨异构推理运行时的 LLM 代理驱动模型转换
From PyTorch to the NPU: LLM-Agent-Driven Model Conversion Across Heterogeneous Inference Runtimes
摘要
边缘AI模型部署是一个多阶段的工程过程,涉及模型转换、算子兼容性处理、运行时集成和精度验证。虽然之前的工作已经展示了 Qualcomm AI Runtime 基于代理的自动化,但更广泛的边缘推理运行时生态系统(包括 Intel OpenVINO、Rockchip RKNN、NVIDIA TensorRT 和 ONNX Runtime)提供了独特的工具链和优化策略。本文将 AIPC(AI Porting Conversion,一种用于 AI 模型部署自动化的 LLM 代理驱动方法,之前在 Qualcomm AI Runtime 上演示)扩展到多运行时场景,提出了一种 LLM 代理驱动方法,用于跨异构推理后端(例如 Intel OpenVINO、Rockchip RKNN、NVIDIA TensorRT 和 ONNX Runtime)自动进行单模型到单运行时部署。我们将边缘人工智能部署分解为标准化、可验证的阶段,并通过代理技能、辅助脚本和分阶段验证循环将特定于运行时的领域知识注入到代理执行流程中。使用代表性视觉模型,我们证明基于代理的部署可以完成从 PyTorch 模型到其可执行推理的转换,针对 x86/NPU 的 OpenVINO、RK3588 的 RKNN、NVIDIA GPU 的 TensorRT 和 Qualcomm NPU 的 ONNX Runtime,重点进行 FP16 精度部署可行性验证。本文的贡献主要在于提供多运行时部署工程实践经验、工具链映射分析、从代理修复负担中消除手动转置插入的布局适应和推理替换层,以及结构化知识注入下代理偏差行为的经验表征,而不是大规模系统基准测试或跨运行时算子修复策略比较。