论文
TREC Million LLM:以可观察行为检索专家模型
Overview of the TREC 2025 Million Large Language Models track
摘要
Agentic AI设想由智能Agent组成生态,以最少人类干预协作完成复杂任务。在这类生态中,每个Agent有专门知识,因而有效选择专家是整体表现的关键。现有方法多假设少量、具有完整文档的模型,但真实专业能力更加多样,静态元数据或人工描述不足以刻画。我们预期未来会有数百万个专用LLM,各自在不同领域或问题上擅长。不同于预定义能力陈述,我们提出基于检索的范式,由助手Agent观察模型行为,动态推断专业能力。收到查询后,助手按已展示能力排序候选LLM,实现高效、自适应专家选择。TREC Million LLM Track将这一范式具体化,把检索目标从文档转为专家LLM。参与者取得由千余LLM的查询、答案和对数概率组成的发现集,需要为每个模型推断有意义的能力表示。对于未见测试查询,系统再按预计表现排序模型,为Agentic AI中的专业能力检索提供首个大规模基准。