论文
合成来源?:审核生成搜索引擎引文以获取人工智能生成来源的证据
Synthetic Sources?: Auditing Generative Search Engine Citations for Evidence of AI-Generated Sources
摘要
通过对话界面,大语言模型 的可访问性不断提高,能够通过利用、综合和引用网络信息(即生成搜索引擎)来回答用户的问题,从而简化了用户的信息查找过程。然而,随着人工智能生成的内容在网络上的激增,目前尚不清楚这些引擎是否能够可靠地省略引用合成来源(即人工智能生成的来源)。如果这些引擎无法做到这一点,那么用户就会面临受到伤害的风险,因为他们会将在生成搜索引擎的响应中合成的人工智能生成源的信息视为与来自权威或官方源的信息相同。为了确定这些引擎是否引用人工智能生成的来源,这项工作使用总共 712 个真实世界的人类生成的查询对四个生成搜索引擎(ChatGPT、Copilot、Gemini、Perplexity)进行了审计,这些查询跨越了公共重要领域:政治、健康和环境。我们的研究结果显示了人工智能生成的来源在所有四个生成搜索引擎中被引用的证据(约占引用来源的 16%),并确定了这些来源所属的关键来源网络域,这些来源在这些引擎和主题中经常被引用。此外,我们观察到生成搜索引擎包括一组稍微狭窄的重复引用的域,同时主要显示大量最少引用的域来响应用户的查询。这些发现有助于越来越多的评估生成搜索引擎风险的工作,目的是提高公众对其局限性的认识,并鼓励采取适当措施来提高这些系统的信息质量和治理。