论文

上下文层的哪一部分起作用?将文本到 SQL 代理中的语义内容与检索支架分离

Which Part of the Context Layer Does the Work? Separating Semantic Content from Retrieval Scaffolding in Text-to-SQL Agents

智能体系统Agent任务评测

摘要

上下文层是分析代理在查询时获取的精选文档,可在文本到 SQL 基准测试中产生巨大的准确性提升。有/无比较不能说明层的哪一部分起作用:语义内容、提供它的检索脚手架或通常伴随它的预先计算的视图。我们报告了 DABStep 上四个模型的四臂消融,将这三个模型分开。该工具是一个数据契约:一个 YAML 工件,它承载域的语义和代理工具强制执行的规则。一只手臂清空冻结合同中散文的每个字段,同时保持工具表面、检索指令、表允许列表和逐字节固定的操作规则。将合约自己的 SQL 表达式编译到视图中给出了预计算层所能达到的上限:它涵盖的所有 176 个任务都是黄金。内容占主导地位。它将困难任务的准确率从 13.9% 提高到 55.1%、22.6% 提高到 56.6%、22.9% 提高到 68.4%、37.0% 提高到 77.4%,击败了每个模型上粘贴到提示中的相同知识。没有内容的脚手架在两个 Flash 模型上得分为 0 到 5 分,在两个前沿模型上得分为 14 到 15 分。相对于编制的上限,合约部门的不足之处在于未能推导出来,并且通过模型能力从 39 点下降到 5 点。该合约胜过提示,因为它需要的规则是一次查找,而不是埋藏在长提示中:它的 SQL 在高达 98% 的时间内携带费用语义,而提示臂为 4%,并且在四个模型中的三个模型上每个正确答案的成本最低。对于从业者来说:语义第一,脚手架第二,仅在代理明显无法推导的情况下才使用预先计算的宏。 Ungovered Arms 提交了 166 个变异语句;管制武器没有。收益仅限于合同范围内。在一种模型中,基准自己的预扣黄金对合约臂的评级为 51.9%,而即时基准的评级为 18.8%。