论文
对话式大模型智能体的网页搜索:从决策和策略到结果与回答
Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses
摘要
对话式大语言模型智能体越来越依赖网页搜索,但智能体搜索的端到端生命周期仍缺乏充分理解。我们首次研究ChatGPT、Claude、Grok和DeepSeek四个主要对话平台的网页搜索,将真实用户交互的实地观察与通过同一平台模型API进行的受控实验结合。我们调查智能体决定调用网页搜索的质量、构造查询的策略、所得搜索结果潜在的域名偏好,以及将搜索结果转换为有依据回答时的选择。我们发现,不同平台和模型的搜索决策差异很大,更频繁地调用网页搜索并不必然带来更高回答质量。我们还说明,对话智能体采用不同且复杂的查询策略,各平台专用搜索引擎返回来自其偏好域名的结果。最后,尽管回答大多以搜索结果为依据,一些主张仍依赖未被引用的搜索结果,引发归因与可靠性方面的担忧。这些发现对未来AI智能体及面向对话检索优化的网页搜索工具设计具有重要意义。
