论文
微语言模型实现即时响应
Micro Language Models Enable Instant Responses
摘要
由于功率和计算限制,智能手表和智能眼镜等边缘设备甚至无法连续运行最小的 100M-1B 参数语言模型,但云推理引入了多秒的延迟,打破了响应助理的幻想。我们引入了微语言模型($μ$LM):超紧凑模型(8M-30M 参数),可立即生成设备上上下文响应的前 4-8 个单词,而云模型则完成它;因此,掩盖了云延迟。我们证明,有用的语言生成能够在如此极端的规模下生存,我们的模型与多个 70M-256M 级的现有模型相匹配。我们设计了一个协作生成框架,将云模型重新构建为延续者而不是响应者,当本地开启器出错时,通过三种纠错方法实现无缝的中间句子切换和结构化的优雅恢复。实证结果表明,$μ$LM 可以发起较大模型无缝完成的响应,这证明了数量级的非对称协作是可以实现的,并为资源极其有限的设备解锁响应式人工智能。模型检查点和演示可在 https://github.com/Sensente/micro_language_model_swen_project 获取。