论文
AgentSelect:叙事式查询到智能体推荐基准
AgentSelect: Benchmark for Narrative Query-to-Agent Recommendation
摘要
LLM 智能体正迅速成为任务自动化的实用界面,但面对爆炸式增长的可部署配置,生态缺乏有原则的选择方法。既有 LLM 排行榜与工具/智能体基准孤立评估组件,且在任务、指标和候选池上彼此割裂,留下关键研究空白:几乎没有查询条件化监督数据可用于学习推荐把骨干模型与工具包耦合的端到端智能体配置。我们以 AgentSelect 弥补这一空白,该基准把智能体选择重构为基于能力画像的叙事式查询到智能体推荐,并系统地把异构评估产物转换为统一、仅正样本的交互数据。AgentSelect 包含 111,179 个查询、107,721 个可部署智能体和 251,103 条交互记录,聚合自 40+ 来源,覆盖纯 LLM、纯工具包和组合型智能体。我们的分析揭示从密集头部复用到长尾、近乎一次性监督的态势转变,基于热度的 CF/GNN 方法变得脆弱,内容感知的能力匹配不可或缺。我们进一步表明,第三部分合成的组合型交互可学习、在受控反事实编辑下引发能力敏感行为,并提升对现实组合的覆盖;在 AgentSelect 上训练的模型还能迁移到公开智能体市场(MuleRun),在未见目录上取得一致增益。总体而言,AgentSelect 提供首个面向智能体推荐的统一数据与评估基础设施,为研究和加速新兴智能体生态确立可复现基础。
