论文

方向性幻觉:新闻落地LLM问答中的意识形态漂移

Directional Hallucinations: Ideological Drift in News-Grounded LLM Question Answering

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)日益被用于回答政治信息问题,包括在事实错误与意识形态扭曲属高风险的选举相关场景。我们提出一个可复现的测量框架:把幻觉——文档落地问答中的无支撑陈述——当作意识形态漂移的诊断信号。使用QBias横跨左、中、右来源的21,727篇专家标注美国政治新闻文章,我们(i)生成文章专属问题,(ii)从三个开放权重LLM与一个专有模型引出文档落地答案,(iii)经参照比较检测句级幻觉,(iv)用微调立场分类器为幻觉句子的意识形态效价分类,(v)探查输出logits以把token级不确定性与幻觉和漂移联系起来。幻觉率跨模型差异显著并集中于争议话题,而幻觉频率的来源意识形态差异温和。相比之下,幻觉内容呈现稳健的左向漂移:多数幻觉句被分类为左倾,包括从右倾来源生成的幻觉。logit级分析显示幻觉产生于高熵生成上下文,且部分模型中不确定性也预测左向漂移——与“不确定性到猜测”机制一致。我们讨论对AI中介政治信息审计与选举相关部署中保障设计的含义。

方向性幻觉:新闻落地LLM问答中的意识形态漂移:论文配图
图 6:混淆矩阵:源文章方向(行)与预测的幻觉方向(列)。无论来源意识形态如何,所有模型都显示出系统性的左移。