论文
当AI进行说服时:针对AI辅助决策中人类信任的对抗性解释攻击
When AI Persuades: Adversarial Explanation Attacks on Human Trust in AI-Assisted Decision Making
摘要
人工智能中的大多数对抗性威胁都针对模型的计算行为,而不是依赖模型的人类。然而,现代人工智能系统越来越多地在人类决策循环中运行,用户在其中解释模型建议并采取行动。大语言模型生成流畅的自然语言解释,塑造用户感知和信任人工智能输出的方式,揭示认知层的新攻击面:人工智能与其用户之间的通信渠道。我们引入对抗性解释攻击(AEA),其中攻击者操纵 LLM 生成的解释的框架来调节人类对不正确输出的信任。我们通过信任错误校准差距来形式化这种行为威胁,该指标捕捉了对抗性解释下正确和错误输出之间的人类信任差异。通过纳入这一差距,AEAs 探索了令人畏惧的威胁,其中有说服力的解释增强了用户对错误预测的信任。为了表征这种威胁,我们进行了一项对照实验(n = 205),系统地改变解释框架的四个维度:推理模式、证据类型、沟通风格和演示格式。我们的研究结果表明,用户对对抗性解释和良性解释的信任几乎相同,对抗性解释尽管不正确,但保留了绝大多数良性信任。当 AEA 非常类似于专家沟通,结合了权威证据、中立语气和适合领域的推理时,就会出现最脆弱的情况。在艰巨的任务、事实驱动的领域以及受教育程度较低、较年轻或高度信任人工智能的参与者中,脆弱性最高。这是第一个系统安全研究,将解释视为对抗性认知渠道,并量化其对人工智能辅助决策中人类信任的影响。
