论文

并非每次调用都需要前沿模型:家庭自动化Agent的逐环节评测

Not Every Call Needs a Frontier Model: Per-Call-Site Evaluation of Small Language Models in a Deployed Agentic Home-Automation System

模型评测AI 基础设施智能体系统Agent 动作执行与治理模型网关模型能力评测

摘要

Agentic 系统发出几种结构上不同类型的 LLM 调用。它路由意图、对操作进行分类、在设备注册表中提供基础语言、规划多Agent管道并编写这些管道运行的 Python 代码。这些调用站点的难度各不相同,但实际上,为最难的站点选择的单一模型可以为所有这些站点提供服务。在这项工作中,我们使用未修改的生产提示和两个真实的 Home Assistant 安装(280 个案例,2520 个评分呼叫),跨已部署的开源家庭自动化框架 (Wactorz) 的五个调用站点评估了从 0.8B 到前沿托管模型的 9 个模型。我们发现每个站点的功能排序方式并不相同,并且较大的模型也并非一律更好:在Grounding驱动方面,一个 4B 模型比其 2B 模型更差。配对测试显示,最佳本地模型与五个站点中的四个站点的托管模型在统计上无法区分。仅代码生成将它们与小型托管模型 (p = 0.039) 和前沿模型 (p = 0.002) 区分开来。聚合准确度还隐藏了特定于驱动的安全故障,其中小型模型以退化方式解决了准确度/拒绝权衡:一个模型 (Gemma4 E2B) 驱动了 87.2% 的站点不拥有的设备请求,而另一个模型则拒绝它收到的每个请求。将每个站点路由到其最佳本地模型的成功率达到 91.8%,而无需每次调用成本即可达到 95.4%。在用户判断的实时部署中,仅托管两个生成站点与托管所有内容(39/43 对 39/43)相匹配,花费了 28% 的支出,并且基准预测的驱动差距恰好是二十六分之一。基准、工具和所有记录均在 https://github.com/waldiez/slm-callsite-eval。 发布

并非每次调用都需要前沿模型:家庭自动化Agent的逐环节评测:论文原图
图 1:一个用户轮流的五个呼叫站点。意图是一个静态门:它在十个Token预算下每轮运行,并固定执行哪个下游站点,因此每个调用站点的模型分配是一个配置值,并且不会在站点之间错误路由。执行器是一片叶子,但价格昂贵;它的提示符包含该网站的整个实体注册表,平均 28,122 个输入Token,这是 81% 的托管支出的所在。 Planner 和 codegen 形成了唯一的链,这使得“仅用于生成”成为一个明确的切入点。 OTHER分支是普通会话,这里不进行评估。