论文
SourceBench:AI 回答能引用高质量网络来源吗?
SourceBench: Can AI Answers Reference Quality Web Sources?
摘要
大语言模型(LLM)越来越多地通过引用网络来源回答查询,但现有评估强调答案正确性而非证据质量。我们提出 SourceBench,一个衡量引用网络来源质量的基准,覆盖信息、事实、论证、社交和购物五类意图的 100 个真实查询。SourceBench 采用八指标框架,涵盖内容质量(内容相关性、事实准确性、客观性)与页面级信号(如新鲜度、权威性/可问责性、清晰度),并含人工标注数据集和校准后与专家判断高度一致的 LLM 评估器。我们用 SourceBench 对八个 LLM、Google Search 和三个 AI 搜索工具的 3996 个引用来源进行评估,并开展进一步实验以理解评估结果。总体上,本工作揭示四点关键新洞见,可指导生成式 AI 与网络搜索方向的未来研究。
