论文
HybridInfer:以手机热余量调度端、边、云大模型推理
HybridInfer: Thermal-Aware Reinforcement-Learning Tier Routing for On-Device, Edge, and Cloud LLM Inference
摘要
小语言模型的端侧推理可保持数据本地、离线运行且无按次费用,能力足够时应优先使用。但端侧受到热约束,作者发现它不只是减速:一款旗舰 Snapdragon 设备持续生成后,GPU 推理运行时会在连续几次请求后崩溃或静默卡住。问题来自当前工具链中的 OpenCL 内核编译及移动 GPU 长提示预填充,即使设备较冷也会复现,长生成尤甚。端、边、云多层路由可缓解压力,但现有方案通常不感知温度,且多在仿真或非移动硬件评测。HybridInfer 使用端侧 Llama 3.2 3B、带检索的边缘 Llama 3.1 8B 和云端 GPT-4o,以手机热余量和问题复杂度估计为状态,通过离线训练的 Q-learning 策略选择层级。奖励兼顾质量、延迟、成本、热惩罚以及奖励端侧执行的本地性加分。作者指出,本地性加分是实现热感知路由的前提,否则最优策略会卸载所有请求。在 210 条提示的真实安卓测试中,学习路由的质量显著高于两种手调启发式方法(配对 Wilcoxon,p<0.02),且在所有自适应条件中成本最低。始终端侧运行在可服务请求上的质量相当,但慢三至六倍,并会在长请求上失败,因此路由的收益是延迟、可靠性和覆盖范围,而非质量。作者称,这是首次在真实硬件上用端侧热余量选择不同能力的 LLM 推理层级。
