论文

工具模式压缩在上下文预算受限的情况下启用代理 RAG

Tool-Schema Compression Enables Agentic RAG Under Constrained Context Budgets

上下文与知识上下文工程

摘要

为语言模型配备数十到数百个工具定义的代理 RAG 系统面临着严重的资源冲突:工具模式消耗检索增强生成所需的相同上下文窗口。我们首次对这种工具上下文权衡进行了系统研究,评估了涵盖 1.5B-32B 本地模型的 14 个模型,以及在 3 个上下文预算(8K、16K、32K)和 28 个工具定义下跨 6,566 个受控 API 调用的一个前沿 API 模型。应用 TSCG 保守配置文件压缩(节省 44-50% 模式词元),我们观察到二进制启用效果:在 8K 词元时,JSON 模式工具定义完全溢出上下文窗口,产生接近于零的 EM(平均 2.6%),而压缩模式恢复 RAG 功能,在所有八个模型中平均精确匹配提升 +20.5 pp(在六个表现出完全启用的模型中,+24.7 pp)。在 32K 时(两种格式都适合),五个测试模型中有四个显示 delta <= 1 pp,证实了效果纯粹是预算驱动的。 HotpotQA 的外部验证(50 个多跳问题)显示在相同溢出场景下 +48 pp EM。 Frontier 扩展测试表明,JSON 模式在约 494 个工具中溢出,而压缩模式在超过 800 个工具时仍保持运行。我们的结果将工具模式压缩确立为约束上下文部署中代理 RAG 的必要基础设施层。所有代码、数据和检查点都是公开的。