论文

对话式大模型智能体的网页搜索:从决策和策略到结果与回答

Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses

智能体系统Agent任务评测

摘要

对话式大语言模型智能体越来越依赖网页搜索,但智能体搜索的端到端生命周期仍缺乏充分理解。我们首次研究ChatGPT、Claude、Grok和DeepSeek四个主要对话平台的网页搜索,将真实用户交互的实地观察与通过同一平台模型API进行的受控实验结合。我们调查智能体决定调用网页搜索的质量、构造查询的策略、所得搜索结果潜在的域名偏好,以及将搜索结果转换为有依据回答时的选择。我们发现,不同平台和模型的搜索决策差异很大,更频繁地调用网页搜索并不必然带来更高回答质量。我们还说明,对话智能体采用不同且复杂的查询策略,各平台专用搜索引擎返回来自其偏好域名的结果。最后,尽管回答大多以搜索结果为依据,一些主张仍依赖未被引用的搜索结果,引发归因与可靠性方面的担忧。这些发现对未来AI智能体及面向对话检索优化的网页搜索工具设计具有重要意义。

对话式大模型智能体的网页搜索:从决策和策略到结果与回答:论文配图
图2:智能体网页搜索的生命周期。