论文

语言模型对算法智能体与人类专家表现出不一致的偏倚

Language Models Exhibit Inconsistent Biases Towards Algorithmic Agents and Human Experts

模型评测模型行为与机制分析

摘要

大语言模型越来越多地用于需要处理来自多种来源信息的决策任务,这些来源既包括人类专家,也包括其他算法智能体。LLM 如何权衡这些不同来源提供的信息?我们考察被充分研究的算法厌恶现象,即人类决策者对算法预测表现出的偏倚。借鉴行为经济学的实验范式,我们评估了八个 LLM 在被委托方被框定为人类专家或算法智能体时如何委托决策任务。为涵盖不同评估形式,我们以两种任务呈现方式开展研究:陈述偏好,通过直接询问对其中一方的信任建模;显示偏好,通过提供两者表现的上下文示例建模。当被要求为人类专家和算法在多样任务上的可信度评分时,LLM 给人类专家更高评分,这与既往人类受访者的结果相关。然而,当展示人类专家与算法的表现并要求在两者之间下有激励的下注时,LLM 不成比例地选择算法,即使其表现明显更差。这些相互矛盾的结果表明,LLM 可能对人类和算法编码了不一致的偏倚,在高风险场景部署时需慎重考虑。此外,我们讨论了 LLM 对任务呈现格式的敏感性,这一问题应在 AI 安全的评估鲁棒性中得到广泛审视。

语言模型对算法智能体与人类专家表现出不一致的偏倚
图D.1:各 LLM 信任差距之间的相关性。