论文

Opt.Gear 技术报告

Opt.Gear Technical Report

模型架构混合架构

摘要

我们推出 OptGear,这是一个专为高效设备部署、实时推理和强大任务能力而设计的基础模型。它包括上下文长度为 64K 的密集模型(1M、270M 和 1B)。我们设计了一种新的混合架构,将卷积键值门控混合器与局部全局注意力相结合,以减少 KV 缓存,而 KV 缓存往往会随着长上下文呈指数级增长。与类似规模的模型相比,该架构在 NPU 上的预填充和解码速度提高了 4.9 倍。从 2T 词元候选语料库中,OptGear 在没有 知识蒸馏 的精选 0.5T 词元子集上进行训练。这是现有基础模型中数据效率最高的。所有模型均附带适用于 ONNX、Qualcomm NPU 和 Apple ANE 的开放权重和部署二进制文件,使 OptGear 成为需要快速、内存高效推理和强大任务功能的边缘应用程序的实用基础。此外,为了扩展设备上生成语言模型的生态系统,我们推出了可部署在微控制器单元 (MCU) 上的 OptGear-1M,这是一种微型语言模型 (TLM)。 OptGear-1M 是第一个在 STM32H747I-DISCO 的 ARM Cortex-M7 CPU 上通过 W4A32 量化实现 20 TPS 的生成语言模型。