论文
AgentSearchBench:面向真实场景AI智能体搜索的基准
AgentSearchBench: A Benchmark for AI Agent Search in the Wild
摘要
AI智能体生态的快速扩张正在改变复杂任务的委派与执行方式,也带来了为给定任务找到合适智能体的新挑战。与传统工具不同,智能体能力往往是组合式的且依赖执行,难以仅凭文本描述加以评估。然而,现有研究与基准通常假定功能描述完备、候选池受控,或只接受可执行的任务查询,对真实的智能体搜索场景研究不足。我们提出AgentSearchBench,一个面向真实场景智能体搜索的大规模基准,由来自多个提供商的近1万个真实世界智能体构建。该基准将智能体搜索形式化为可执行任务查询与高层任务描述两种形态下的检索与重排序问题,并以基于执行的性能信号评估相关性。实验揭示语义相似度与智能体实际表现之间存在一致的鸿沟,暴露了基于描述的检索与重排序方法的局限。我们进一步表明,包括执行感知探测在内的轻量级行为信号能显著提升排序质量,凸显了将执行信号纳入智能体发现的重要性。我们的代码见 https://github.com/Bingo-W/AgentSearchBench。
