论文

边缘侧智能体性能:来自基准测试的洞见

Agentic Performance at the Edge: Insights from Benchmarking

智能体系统Agent任务评测

摘要

智能体人工智能(AI)天然适合物联网(IoT)与边缘系统,但边缘部署通常只能使用约80亿参数或更小的模型。一个重要的问题是:当模型规模受内存、功耗与延迟预算约束时,智能体任务质量会损失多少?为回答这一问题,本文提供了一项初步实证研究,考察面向边缘的模型缩放、通用型与面向代码型模型的效应,以及固定协议下启用工具的执行。我们提出了一种领域条件化评估方法、一项基于实现的模型-工具交互分析、约束条件下模型选择的实用指南,以及一项失败模式分析,揭示了不同模型家族中截然不同的语义型与执行型失败模式。我们的核心发现是:边缘智能体质量并非参数量的简单函数。稳健的部署依赖于模型选择与工具工作流的联合设计。领域条件化分析揭示了精度-延迟空间中的Pareto前沿,可依据运营优先级指导策略选择。