论文

设备优先反馈:迈向移动原生 LLM 驱动的神经架构搜索

Device-First Feedback: Toward Mobile-Native LLM-Driven Neural Architecture Search

AI 基础设施模型部署

摘要

在真实的移动硬件上部署 大语言模型 (LLM) 生成的卷积神经网络需要的不仅仅是 GPU 验证准确性:INT8 TensorFlow Lite 导出、委托选择和设备上延迟共同决定模型是否可用。我们提出了一个自动化移动部署管道,通过 GPU 评估、INT8 导出和物理设备基准测试,闭合从 QLoRA 微调 到架构生成 LLM 的循环,再到训练语料库的门控增强。该管道是完全脚本化的,无需人工干预即可循环运行,并在中断后提供恢复支持。我们在 Samsung SM-P613 平板电脑(种子 42,每个周期 20 个模型,周期 0-6)上的两个基准(CIFAR-10 和 CIFAR-100)上评估相同的冻结协议。在 CIFAR-10 上,第 1 周期已被接受,移动部署得分比基线提高了约 25.6 倍,平均量化精度为 46.9%;后面的周期提高了 GPU 精度,但无法满足非递减移动门的要求。在 CIFAR-100 上,QLoRA 之前的基线保留了最佳的移动分数;迭代轮次提高了 GPU 准确度(高达 26.2%),但无法超过设备上的周期 0,并且训练池在第一个接受轮次后停在 19 个示例处。这两项研究共同表明,闭环 GPU 微调 不能保证单调移动增益,尤其是在较困难的分类任务上,并且需要多数据集、设备上测量来对部署目标进行压力测试。我们发布了具有 95% 置信区间的每个周期指标、所有数据和完整的再现命令。