论文
带宽高效且保护隐私的边缘云多对多语音翻译
Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation
摘要
多模态大语言模型 (MLLM) 已展现出语音到文本翻译 (S2TT) 的巨大潜力。然而,现有的部署范例面临着严峻的挑战:纯粹的设备端模型受到资源限制,而集中式云系统通过传输原始语音数据而带来严重的隐私风险和带宽瓶颈。此外,大多数模型都表现出以英语为中心的偏差,限制了多对多的翻译缩放。在本文中,我们提出了边缘云语音识别和翻译(ESRT),这是一种隐私保护和带宽高效的协作边缘云 MLLM 框架。具体来说,我们设计了一种边云分离推理架构,在设备上保留轻量级语音编码器和适配器,仅将高度压缩的中间特征传输到云端。这从根本上防止了声纹泄漏,并将带宽需求降低了高达 10$\times$。为了克服以英语为中心的瓶颈,我们引入了具有数据平衡的多任务加权课程学习策略,以确保强大的跨语言一致性。对 FLEURS 数据集的大量实验表明,我们的模型 ESRT-4B 和 ESRT-12B 在 45 种语言(45 美元×44 美元方向)上实现了最先进的多对多 S2TT 性能。发布代码和模型是为了促进可重复、具有隐私意识的 MLLM S2TT 研究。代码和模型发布于 https://github.com/yxduir/esrt。
