论文

MAVEN:提升智能体工具调用的泛化能力

MAVEN: Improving Generalization in Agentic Tool Calling

智能体系统Agent Harness

摘要

跨智能体工具调用环境的泛化仍是可靠智能体推理系统的核心挑战。尽管大语言模型在单个基准上取得强劲结果,它们组合推理策略、保持中间状态以及跨领域协调工具的能力仍未被充分探索。我们提出MAVEN(Modular Agentic Verification and Execution Network,模块化智能体验证与执行网络),一个用于结构化分解、自适应工具编排与中间验证的轻量符号推理脚手架。我们在成熟的工具调用基准上评估MAVEN,包括BFCL v3、TauBench、Tau2Bench与AceBench,并引入MAVEN-Bench——一个针对多步数学与物理推理的压力测试基准,具有显式验证与对抗性任务组合。MAVEN-Bench揭示出局部推理质量与端到端任务成功之间的显著差距;在直接的MAVEN-Bench运行中,MAVEN无需额外训练便将其GPT-OSS-120b基础模型从48%提升到71%准确率。同时,它在使用估计成本比约1/10的开源权重骨干的情况下,仍与前沿专有基线保持竞争力,这表明轻量级、以验证为中心的脚手架能够强化组合推理,并推动对真实环境中智能体更具过程感知的评估。

MAVEN:提升智能体工具调用的泛化能力:论文配图
图 1:系统通过三个阶段处理会话输入:上下文缓冲提取并构建相关信息,操作合成生成原子的、可测试的任务,同时处理提前终止和缺失的先决条件,调用生成生成具有可审核性的机器可解释的操作,保持推理和执行分离。