论文
AgentHop:Agentic 多跳科学问答的诊断基准
AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering
摘要
Agentic 任务需要大语言模型来与世界交互,利用有限的资源跨多个步骤导航信息并收集证据。由于这种复杂性,agentic 任务失败的原因多种多样,查明这些失败原因对于诊断和改进 agentic 系统至关重要。然而,现有的基准测试往往关注单个排行榜分数,从而使潜在的故障模式变得不透明。为了填补这一空白,我们引入了 AgentHop,这是一个包含 1,011 个多项选择问题的诊断基准,与固定词元、回合和工具调用约束下的受控七工具沙箱配对。 AgentHop 通过沿Agent操作的四个轴(检索、合成、工具调用和资源管理)剖析单个准确度分数来揭示模型漏洞。在 19 个模型中,我们发现行为按模型系列进行聚类,工具调用签名揭示了不同的系列指纹:GPT 模型提前提交,Anthropic 和 GLM 检查点在提交前进行验证,DeepSeek 和 Kimi 过度搜索,而 Gemini-3 Pro 保持平衡。分解的轴进一步揭示了家族内部的结构:Claude Opus 4.6 和 Sonnet 4.6 的准确度相差一个点,但在检索与合成的重点上存在分歧,Opus 检索更多,Sonnet 综合更好。我们发布了完整的基准集和Harness来支持诊断Agent基准测试。