论文

循环语言模型改进组合式工具调用

Looped Language Models Improve Compositional Tool Calling

模型架构递归架构

摘要

循环语言模型(looped language models)已在推理基准上展现出可喜的结果,但其在智能体工具使用方面的潜力基本上尚未被探索。我们在组合式工具调用场景中研究这一问题:模型必须协调多个API调用、维护中间状态,并在工具交互之间保持依赖关系。我们在API-Bank、BFCL和NESTful上评估原生与改造的循环语言模型,在相同监督微调配方下比较循环与非循环模型,并在推理时改变循环深度。在受控实验中,循环计算总体上有利于组合式和依赖感知的工具使用,而对孤立API调用的收益较小且更依赖具体模型。多步工具使用的准确率通常随循环深度增加而上升;不过,自适应推理通过仅在需要时分配额外计算,达成了更有利的计算-性能权衡。我们的结果表明,循环语言模型是智能体系统的一种有前景的架构,适用于需要可靠规划、协调和执行组合式工具使用工作流的场景。

循环语言模型改进组合式工具调用:论文配图
图5:跨循环深度的迭代改进。Ouro-1.4B 在两步 NESTful 组合任务上的表现。调用以 function(argument=value) -> answer 的形式展示。深度 1 时,模型对工具目录中不存在的函数发出单次调用,并遗漏了依赖调用;深度 2 时,它恢复了两次调用的结构,但第一个函数仍不在目录中,且变量引用无效。深度 3 与 4 与 gold 序列一致,包括输出到输入的引用 $var1.output_0$。