是什么阻止了小语言模型驱动数据库代理
What Stops a Small Language Model From Driving a Database Agent
摘要
小型开放权重语言模型被认为无法完成代理数据库工作,因为它们缺乏推理能力。我们针对生产系统进行测试。在十一天的时间里,我们在六个任务表面上驱动了开源 SQL 客户端的代理模式,其中包括 39 个本地服务的开放权重模型和一个托管控件:8,199 次运行、110,711 个账本事件、14,008 个被拒绝的工具调用。在 2,100 起模型归因的代理模式损失中,有 1,590 起(即 75.7%)来自至少调用了一种工具的运行。这大部分是在重采样模型而不是运行中幸存下来的:它存在于 99.7% 的聚类重采样中,并且在 22 个模型中的 15 个模型中至少有 20 个损失。其中,运输(使用工具但从未获得可交付成果的运行)是最大的类别,占 36.2%;能力(完全不使用任何工具的运行)是最小的类别,占 17.3%;我们报告说,排序是该语料库的一个属性,而不是一般发现,因为按模型进行聚类,它只保留了 74.5% 的重采样。传输故障分解为几个机械参数形状。生产分类账记录拒绝代码,但从不记录模型的论据,因此这些代码在十天内不可见;捕获它们暴露了五个服务器缺陷,其中一个缺陷要求在一个工具上有一个字段,并禁止在组成它的同级工具上使用该字段,然后因缺少该字段而导致运行失败。五次服务器更改,没有涉及模型、提示或采样设置,将 6 个模型从 30 个单元格中移动了 6 到 21 个单元格。我们还报告了一个我们认为会影响已发布的本地模型基准测试的混淆,其中包括我们的:在没有上下文上限的情况下,一个 7.1 GB 模型在其完整的 262,144 个词元窗口中被接纳,并在 64 GB 机器上保留 51 GB,在任何普通日志中产生的运行与模型超时无法区分。语料库、评分器和重新生成每个数字的验证器均已发布。