论文
立场漂移:人工智能介导的沟通如何扭曲我们的信息
Stance Drift: How AI-mediated Communication Distorts Our Message
摘要
大语言模型 (LLM) 越来越多地调解人类交流,从起草电子邮件到总结科学报告,但它们是否忠实地保留了演讲者的立场仍然很大程度上未经测试。我们将 AI 介导的通信建模为两步生成-提取管道:一个LLM从指定的立场生成参数,第二个LLM从该参数提取立场。我们将管道表示为五个李克特型立场类别的概率状态转换,并将立场保留率(SPR)定义为提取的立场与初始立场匹配的平均概率。在 112 个辩论命题中,测试的 9 个LLM在默认配置下没有一个 SPR 超过 0.7。三种漂移模式占了大部分漂移:极化、偏离中性和翻转。在测试的缓解策略中,包括上下文学习、带有打乱选项的多重提取、断言和反射,仅在 GPT-5.4 的反射提示中添加中等推理努力即可显着提高 SPR,达到 0.775,但极化仍然是最大的模式,过渡质量为 0.119。对单个命题与人类提取的探索性比较表明,在生成和提取阶段都会出现漂移。这些结果表明人工智能介导的交流中存在保真度差距,这对新闻业、策略审议、科学交流以及通过语言模型传递充满观点的信息的其他领域具有影响。
