论文
相似的准确性,不平等的证据:搜索 API 作为工具使用代理的决策面
Similar Accuracy, Unequal Evidence: Search APIs as Decision Surfaces for Tool-Using Agents
摘要
搜索 API 公开排名片段、URL 和元数据,代理决定是否回答、再次搜索或获取页面。我们使用一个冻结的 GPT-5.4 代理、一个固定的编排工具以及跨 Brave、Tavily 和 Firecrawl 的共享页面获取后端,对来自 254 个问题 SealQA-Hard 子集的 100 个问题的固定样本进行决策面评估这些接口。 Kimi-K2.6 预言机标记了可见的 URL 级证据;单独的答案审核会在 100 个答案中得出 25 个、25 个和 26 个正确答案。这些计数表明观察到的准确性相似,但并未建立等效性。在测试的配置下,Brave 提供了更多的预取支持以及更大的片段表面; Tavily 在轨迹池支持观察中拥有更大的 1 级份额; Firecrawl 与更广泛的探索相关。首次搜索查询级指标将支持可用性与排名区分开来,而矛盾暴露则补充了矛盾标准答案比率。回顾性预言机联盟涵盖 44/100 个问题,而最佳个体提供商则涵盖 26/100 个问题:上升空间为 18 个百分点。观察到的证据和行动差异促使我们结合代理策略和检索预算来评估搜索 API。