论文
LiveBrowseComp:搜索智能体是在搜索,还是只在验证已知?
LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?
摘要
基于LLM的搜索智能体是在真正搜索,还是在利用网络验证它们已知的内容?我们在BrowseComp上用三种诊断手段研究这一问题。我们的分析揭示了内在知识依赖(IKD):即便可以使用工具,智能体也常常依赖内在知识——即检索之前就编码在模型中的信息——而非外部证据。智能体在没有工具的情况下能回答多达44.5%的BrowseComp问题,其搜索查询中超过一半由内部生成的假设而非检索到的线索产生,且当支持答案的证据被移除后其表现反而差于闭卷基线。这些结果表明,静态搜索基准可能奖励的是依赖记忆的验证而非证据驱动的发现,将智能体已经知道什么与它们能找到什么混为一谈。随后我们提出LiveBrowseComp,一个旨在超越内在知识覆盖来评估智能体的深度搜索基准。它包含335个人工撰写的问题,其答案取决于基准构建之前90天内发布的事实,这些问题取自六个持续更新的来源,并经过筛选以排除全球性显著事件。在LiveBrowseComp上,所有被评估智能体的闭卷准确率都低于2%,搜索增强得分相对BrowseComp下降25-40分,且先前的模型排名不再能可靠地预测表现。LiveBrowseComp已发布于 https://huggingface.co/datasets/Forival/LiveBrowseComp。
