论文
在平行世界中评估搜索Agent
Evaluating the Search Agent in a Parallel World
摘要
集成网络搜索工具显著扩展了LLM应对开放世界、实时和长尾问题的能力。然而,评估这些搜索Agent面临严峻挑战。第一,构建高质量的深度搜索基准成本高昂,而未经验证的合成数据常受制于不可靠的来源。第二,静态基准面临动态过时:随着互联网信息演变,需要深度研究的复杂查询常因热度上升而退化为简单检索任务,真值也因时间偏移而过时。第三,归因歧义干扰评估,因为Agent的性能往往由其参数化记忆而非实际的搜索与推理能力主导。最后,对特定商业搜索引擎的依赖引入了妨碍可复现性的变异性。为解决这些问题,我们提出一个新框架Mind-ParaWorld,用于在平行世界中评估搜索Agent。具体而言,MPW采样真实世界实体名称来合成处于模型知识截止之后的未来场景与问题。一个ParaWorld Law Model随后为每个问题构造一组不可分割的Atomic Facts和唯一真值。在评估期间,Agent不再检索真实世界结果,而是与一个基于这些不可违背的Atomic Facts动态生成SERP的ParaWorld Engine Model交互。我们发布了MPW-Bench,一个覆盖19个领域、包含1,608个实例的交互式基准。跨三种评估设置的实验表明,尽管搜索Agent在信息完整时擅长证据综合,但其性能不仅受限于陌生搜索环境中的证据收集与覆盖,也受制于不可靠的证据充分性判断和何时停止的决策瓶颈。
