论文
AgBench:Agentic 个人人工智能设备的人工智能基准
AgBench: Agentic AI Benchmarks for Personal AI Devices
摘要
Agentic AI 系统越来越依赖云托管的大语言模型进行规划、工具使用和迭代执行,引发了对 API 成本和数据暴露的担忧。个人人工智能设备的进步使Agent能够在本地执行,但设备上的有限资源可能会影响任务的成功和性能。现有的基准不足以系统地描述设备、工作负载和部署架构之间的这些权衡。我们推出了 AgBench,这是一个基准套件和开放工件,用于在个人设备上对 Agentic AI 进行可重复的评估。使用 AgBench,我们评估 Agentic 工作负载的本地、混合和云执行情况,检查任务成功、延迟、云 API 成本和数据暴露。我们从超过 1.6207 亿个数据点中得出的结果表明,个人人工智能设备可以在本地完成许多代理任务,但仅本地执行通常比仅云执行任务成功率较低且完成时间较长,尤其是随着并发性的增加。仅本地执行消除了云模型 API 成本以及云Agent的敏感信息暴露。混合执行可以提高任务成功率,但其云成本和数据暴露取决于Agent如何划分工作和共享信息。没有单一架构在任务成功、产出、云成本和数据暴露方面表现最佳;部署选择应反映预期的工作负载和设备功能。 AgBench 可在 https://anonymous.4open.science/r/AgBench-2777. 获取