论文

VAKRA:工具使用策略下跨API与知识检索的多跳推理评估

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

智能体系统Agent任务评测

摘要

部署在企业环境中的智能体必须跨结构化API与文档集合进行推理,但现有基准对这些能力的评估彼此割裂。我们提出VAKRA(eValuating API and Knowledge Retrieval Agents),一个包含62个领域、超过8,000个可执行API的基准,其任务覆盖三种难度递增的设定:多样的API交互风格、对结构化API的多跳推理,以及在自然语言工具使用策略约束下的多源推理。正确性通过将预测的工具调用在真实API上重新执行来验证,并允许多条有效路径。我们使用固定的ReAct框架将模型能力与智能体架构解耦,对前沿模型与开源权重模型进行评估,发现即使最好的模型在单跳端点式任务上也仅取得70.4%,在组合式API上降至50–51%;随着推理深度增加性能下降超过50%,而策略约束的问题暴露出严重失败(在不可回答的问题上低至2.4%)。轨迹分析显示,失败集中在语言中介的推理环节——实体消歧、跨源锚定,而非工具调用机制。代码已在https://github.com/IBM/VAKRA发布。数据集已在https://huggingface.co/datasets/ibm-research/VAKRA发布。

VAKRA:工具使用策略下跨API与知识检索的多跳推理评估:论文配图
图1:企业工作流示例,展示推理挑战,包括 (i) API 驱动的消歧、(ii) 跨来源锚定(grounding)、(iii) 参数对齐,以及 (iv) 策略推理。