论文
异构AI加速器的模型与硬件自动协同适配
Automatic Model-Hardware Co-Adaptation for Heterogeneous AI Accelerators
摘要
大语言模型 现在的发展速度快于生产推理系统的移植和优化速度。新版本改变了注意力、MoE 路由、量化格式、KV 缓存布局和并行执行模式,而部署的加速器组在硬件代、框架分支、操作符库、编译器后端和通信运行时之间仍然是异构的。因此,在现有硬件上提供新模型是一个模型-框架-内核-硬件协同适应问题。我们提出了 MetaInfer,一个 LLM 代理系统,它将推理适应制定为在成本计算的执行适应图上的路由搜索。该图连接了模型语义、框架调度、内核选择、硬件功能、运行时证据和服务目标。 MetaInfer 在执行期间构建和更新此图,通过补丁恢复丢失或阻塞的路由,并通过分阶段验证和端到端分析降低路由成本。三个真实部署案例——NVIDIA A800 上的 DeepSeek V4 Flash、NVIDIA A800 上的 GLM 5.3 Flash 和 Hygon K100AI DCU 上的 DeepSeek V4 Flash——展示了部署修复、跨模型知识传输以及跨异构加速器软件堆栈的可移植性。