论文

面向移动设备实时直播聊天的端侧翻译实证研究

An Empirical Study of On-Device Translation for Real-Time Live-Stream Chat on Mobile Devices

模型评测模型能力评测

摘要

尽管端侧AI模型具有效率优势,但针对真实世界部署所需的实际层面(如设备的CPU利用率和热状态)的研究仍然很少。本文通过大量实验,考察在实际服务中部署端侧模型必须解决的两个关键问题:(i)端侧模型的选择及各模型的资源消耗,(ii)端侧模型在领域适配方面的能力与潜力。为此,我们聚焦于翻译直播聊天消息这一任务,并人工构建了LiveChatBench,一个由1,000个韩英平行句对组成的基准。在五款移动设备上的实验表明,尽管服务庞大且异质的用户群需要对高度受限的部署设置和模型选择进行仔细考量,所提方法在定位明确的目标任务上仍取得了与GPT-5.1等商业模型相当的性能。我们期望这些发现能为端侧AI社区提供有意义的见解。

面向移动设备实时直播聊天的端侧翻译实证研究 配图
图 1:不同端侧模型在 LiveChatBench 上的移动设备温度结果。