论文

面向本地部署检索增强工厂智能体的测量驱动子网络选择

Measurement-Driven Sub-Network Selection for On-Premise Retrieval-Augmented Factory Agents

模型优化端侧模型

摘要

现场助理可以让工厂工人通过对话方式访问机器文档,但能够完成该任务的模型很少适合车间硬件。我们表明,在结构压缩和基于检索的适应之后,模型大小不再是适应答案质量的可靠预测因素:一般能力几乎随参数计数线性下降,而判断的检索增强答案质量则不然。因此,我们将部署视为适应后选择问题,根据判断的答案质量和在可配置的通用能力底线和内存预算下测量的设备吞吐量,为每个设备分配一个子网络;单独优化尺寸、速度或质量的规则都会放弃能力或吞吐量。通过三明治式就地蒸馏训练的权重共享超级网络使这种选择变得便宜。在制造手册案例研究中,提取成本占未修剪模型判断质量的 13.7%,基于检索的蒸馏将其恢复到 4.6% 以内,弥补了三分之二的损失,并且同一助手以 1.3 至 5 瓦的待机功率运行在三个异构边缘层。