论文
用语言模型表征决策中的修辞不一致
Characterizing Rhetorical Misalignment in Decision-Making with Language Models
摘要
人类的决策往往受到一系列有据可查的认知偏见的影响。随着 大语言模型 (LLM) 越来越多地融入高风险的人类人工智能决策中,重要的是要了解它们的输出是否会放大潜在的偏见、这如何影响人类决策,以及最重要的是,它是否会导致有害后果。在这项工作中,我们开发了一个决策理论框架来研究修辞错位,这是一种失败模式,其中 LLM 对于给定的决策上下文使用修辞上不恰当的表达形式,从而导致次优的人类决策。我们使用美国医学执照考试整理的数据集,通过现实临床决策中的人体实验对这一现象进行了实证研究。通过测量 LLM 生成的信息如何影响决策,我们观察到 LLM 在不同模型中导致平均 2.81% 的有害决策翻转率,其中临床医生参与者从正确答案变为错误答案。参与者报告的理由提供的证据表明,这些修订与 LLM 使用的语言密切相关,可能会引发不同类型的认知偏差,包括锚定、权威偏差和损失厌恶。为了实现可扩展的评估,我们使用 LLM 模拟的决策者来实例化我们的理论框架,以计算方式测量修辞偏差。我们的研究结果揭示了一个以前在高风险领域未被认识到的安全问题:一个模型可以与事实相符,但仍然通过其修辞表达造成伤害。