论文

超越流畅生成:用于边缘部署的 Sub-2B 小语言模型中 MCP 式工具调用的 CPU 可靠性基准

Beyond Fluent Generation: A CPU Reliability Benchmark for MCP-Style Tool Calling in Sub-2B Small Language Models for Edge Deployment

模型评测鲁棒性、公平性与可信度评测

摘要

资源受限的单板计算机(包括 Raspberry Pi、NVIDIA Jetson Nano、Arduino UNO Q、Orange Pi 和 LattePanda)激励设备上的小语言模型 (SLM) 代理,减少云依赖性、改善数据局部性并容忍间歇性连接。模型上下文协议 (MCP) 式的工具调用需要的不仅仅是流畅的生成:代理必须发出机器可读的 JSON、选择正确的工具、提供所有必需的参数并避免意外操作。我们通过在贪婪解码和核心采样下,在涵盖天气检索、网络搜索、计算、电子邮件撰写和任务创建的 100 个提示上评估低于 20 亿个参数 Phi-1.5、Pythia-1.4B、TinyLlama-1.1B-Chat、Qwen2.5-0.5B 和 Qwen2.5-1.5B 的 5 个开放权重模型,建立了一个与平台无关的 CPU 基线。恢复解析器会剥离 Markdown 围栏,提取大括号分隔的子字符串,并对可解析性、工具名称正确性、参数完整性和值一致性进行评分。在此标准下,Qwen2.5-1.5B达到75%(贪婪)和79%(采样); Qwen2.5-0.5B 达到 72%(贪婪),但在采样下下降至 32%。 Phi-1.5 得分 0%; Pythia 和 TinyLlama 最多达到 7%。严格的事后审计发现,1,000 个原始响应中只有 5 个可以直接解析为 JSON,这暴露了对输出恢复的几乎完全依赖。 CPU 资源探测显示 Qwen2.5-1.5B 需要 7,960 MiB 和 30.782 秒平均延迟; Qwen2.5-0.5B 使用 3,637 MiB 和 10.627 s,揭示了边缘部署的可靠性与资源权衡。这些结果不直接涵盖指定的板或完整的 MCP 实施。安全部署需要架构验证、约束生成、最低权限执行以及后续操作的人工升级。