论文
使用边缘设备对社交机器人的本地语言模型进行基准测试
Benchmarking Local Language Models for Social Robots using Edge Devices
摘要
专为社交互动教学支持而设计的社会教育机器人,例如机器人学习伴侣(RSC),尽管计算能力严重有限,但仍依赖于响应式、保护隐私的交互。然而,在教学应用中边缘计算的语言模型的系统基准测试方面存在差距。本文对用于边缘硬件本地部署的 25 种开源语言模型进行了基准测试。我们从三个维度评估每个模型:推理效率(每秒词元数、能耗)、常识(六类 MMLU 子集)和教学效果(LLM 评级的教学质量),使用 Raspberry Pi(RPi)4 作为主要平台针对五名独立的人类评估者进行验证,并在 RPi5 和笔记本电脑 GPU 上进行额外比较。结果揭示了明显的权衡:不同模型的吞吐量和能源效率存在一个数量级以上的差异,MMLU 准确度范围从近乎随机到 57.2%,并且教学效果并不与任一指标单调相关。在评估的模型中,Granite4 Tiny Hybrid (7B) 实现了很强的整体平衡,达到每秒 2.5 个词元、每焦耳 0.90 个词元以及 54.6% MMLU 准确率;高 MMLU 准确度对于高教学成绩来说似乎并不是必需的。对四个代表性模型的人工验证保留了自动排名排序(Pearson r = 0.967,n = 4)。基于这些发现,我们为 RSC 提出了一种三层本地推理架构,可以平衡资源受限硬件上的响应能力和准确性。