评估商业人工智能聊天机器人作为新闻中介的作用
Evaluating Commercial AI Chatbots as News Intermediaries
摘要
人工智能聊天机器人正在迅速改变人们接触新闻的方式,但之前还没有研究系统地测量这些系统及其专有的搜索集成和检索合成管道处理跨语言和地区的新事实的准确性。我们对六个 AI 聊天机器人(Gemini 3 Flash 和 Pro、Grok 4、Claude 4.5 Sonnet、GPT-5 和 GPT-4o mini)进行了为期 14 天(2026 年 2 月 9 日至 22 日)的评估,评估内容涉及来自六个区域服务(美国和加拿大、阿拉伯语、非洲、印地语、俄语、土耳其语)当日 BBC 新闻报道的 2,100 个事实问题。对于几个小时前报告的事件的问题,最好的系统可以实现超过 90% 的多项选择准确率。然而,相同的系统在自由反应评估下损失了 11-13%,在整个队列中损失了 16-17%。我们进一步描述了三种故障模式。首先,每个模型在印地语上的准确率都是最低的(79% vs. 其他地方的 89-91%),并且引用表明存在英语检索偏差(例如,回答印地语查询的模型引用英语维基百科的次数比任何印地语渠道都多)。其次,70% 以上的错误是由检索而非推理造成的。当模型检索到正确的来源时,它们通常会提取正确的答案;问题是首先要找到正确的来源。第三,当问题包含微妙的错误前提时,模型在结构良好的问题上达到 88-96% 的准确率会下降到 19-70%,最脆弱的模型在 64% 的情况下接受捏造的事实。我们还发现了一个检测精度悖论:最好的错误前提检测器在对抗精度(弃权率)方面排名第二,而较弱的检测器排名第一,这表明前提检测和答案恢复是部分独立的能力。总体而言,这些表明高精度可以掩盖系统性的区域不平等、对检索基础设施的几乎完全依赖以及对真实用户提出的不完美查询的脆弱性。