已有研究表明,大语言模型(LLM)能够在多种情境中有效说服人们。但这种说服力是否有利于真相而非虚假,或者LLM是否同样容易传播和反驳错误信念,仍不清楚。我们在三项预注册实验中研究这一问题:参与者(2,724名美国人)与GPT-4o讨论一种自己尚不确定的阴谋论,模型被要求反驳该阴谋论(debunking)或支持它(bunking)。使用移除护栏的越狱版GPT-4o时,AI提高阴谋论信念的效果与降低它的效果同样强。令人担忧的是,与反驳阴谋论的AI相比,支持阴谋论的AI获得更积极的评价,并更大程度地提高了参与者对AI的信任。出乎意料的是,标准GPT-4o产生了非常相似的效果,OpenAI设置的护栏几乎没有阻止模型传播阴谋论信念。不过,纠正性对话能够逆转这些新产生的阴谋论信念;仅通过提示要求GPT-4o只使用准确信息,也能显著降低其增强阴谋论信念的能力。结果说明,LLM有强大的能力传播真相与虚假,但可能存在缓解这种风险的方法。
图 4:跨研究来看,对于越狱版与默认版 GPT-4o,“传谣”(bunking)与“辟谣”(debunking)的说服力相当,但真值约束提示会急剧削弱 bunking,同时保留 debunking 效果并提升声明层面的真实性。A) 展示的是各研究与条件下、经基线调整后对方向一致信念改变的处理效应,由一个线性模型估计,该模型将信念变化(编码为正值反映朝模型被指派方向的移动)对条件、研究、二者的交互项以及基线信念进行回归。对于研究(Jailbroken、Standard、Truth-Constrained 与 Truth-Constrained [Compliant])与条件(bunking 对比 debunking)的每种组合,点表示在研究特定平均基线处相对基线的预测平均变化(以 0–100 量表上的信念点计),水平线表示 95% 置信区间(稳健 HC3 标准误)。在每个研究行内,括号与显著性星号表示该研究内 bunking 与 debunking 之间的差异。在越狱(Jailbroken,研究 1)与标准(Standard,研究 2)的 GPT-4o 设定中,bunking 与 debunking 的效应都很大且量级相近,表明说服的对称性。然而,在真值约束提示(Truth-Constrained,研究 3)下,debunking 仍然保持强效,而 bunking 的效应大幅减弱;当仅限于模型确实尝试诱导阴谋信念的对话(Truth-Constrained [Compliant])时,这种衰减更加明显,这说明指示模型“始终使用准确且真实的论证”会选择性地削弱其提升阴谋信念的能力。B) 展示的是各研究与条件下会话级平均声明真实性的分布。对于每段 AI 与参与者的对话,AI 作出的各条事实性陈述被逐条抽取,并使用 Perplexity 的 Sonar Huge/Pro 模型进行事实核查,该模型为每条声明赋予 0–100 的真实性得分;这些得分在会话内取平均。小提琴图展示各会话平均真实性的完整分布,叠加的箱线图概括中位数与四分位距,y 轴覆盖完整的 0–100 范围。在越狱与标准条件(研究 1 和 2)下,debunking 对话的平均真实性通常高于 bunking 对话(例如研究 1 中约为 79 对 70,研究 2 中约为 89 对 77);而在真值约束条件(研究 3)下,bunking 与 debunking 对话的平均真实性都聚集在很高的水平(约 90),反映出真值提示在提升整体事实准确性方面的有效性。C) 展示的是各研究与条件下每段对话中高真实性声明与低真实性声明的平均数量。堆叠柱形显示每段对话产生的事实性声明的平均总数,并按高于/低于 40/100 的低真实性截断值分解,柱内标签报告低真实性声明的百分比。该面板显示,在越狱与标准条件下,bunking 对话比 debunking 对话包含更多低真实性内容,且其声明中低真实性内容占比更高;而在真值约束提示下,bunking 与 debunking 都急剧降低了低真实性声明的出现频率。与此同时,真值约束下的 bunking 模型尽管受到这些约束,仍施加了一定的说服影响,这意味着它不仅可以借助彻头彻尾的虚假内容助长阴谋论,还可以通过以误导性或剥离上下文的方式选择性呈现准确信息来做到这一点(图 S8–S11;表 S9–S11、S16)。