论文
LLM信任谁?人类专家比其他LLM更重要
Who Do LLMs Trust? Human Experts Matter More Than Other LLMs
摘要
大语言模型(LLM)越来越多地运行在会接触到社会信息的环境中,例如其他智能体的回答、工具输出或人类推荐。对人类而言,这类输入对判断的影响取决于信息来源的可信度与共识的强度。本文考察LLM是否表现出类似的影响模式,以及它们是否比来自其他LLM的反馈更看重来自人类的反馈。在阅读理解、多步推理与道德判断这三个二元决策任务中,我们向四个指令微调LLM呈现先前回复,并将其归因于朋友、人类专家或其他LLM。我们操纵群体是否正确,并改变群体规模。在第二个实验中,我们引入单个人类与单个LLM之间的直接分歧。在所有任务中,模型对标注为来自人类专家的回复表现出显著更强的从众,即使该信号不正确时也是如此,并且相比面向其他LLM,它们更容易因专家而修改自己的答案。这些结果表明,专家标签对当代LLM充当一种强先验,暗示存在一种跨决策领域泛化的、对可信度敏感的社会影响。