论文

贾维斯,跟我说话:用于自动赛车的开源边缘部署语音助手框架

Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars

AI 基础设施模型部署

摘要

大型语言模型的最新进展提高了它们作为语音助手后端组件的有效性,特别是在意图理解和上下文感知输入分类方面。然而,在线托管模型引入了网络依赖性和可变推理延迟,限制了它们对时间关键型自动驾驶应用的适用性。在这项工作中,我们通过开发 Jarvis 来解决这些问题,Jarvis 是一种用于自动驾驶车辆高级行为命令的离线语音助手。其架构将语音识别和合成与自然语言命令分类集成到一个轻量级的本地框架中。 Jarvis 核心组件是一个文本到命令分类器,使用 Mistral 7B 模型的特定领域微调构建,展示了低延迟推理。我们的实验评估表明,我们的解决方案优于更大的在线托管模型,实现了 97.63% 的意图识别准确率,平均处理延迟为 1.39 秒,非常适合需要快速响应时间的操作。为了支持进一步的研究和微调,我们提供了开源实现。