论文

作为社会人口统计学代理的主题:对话情境如何影响 LLM 答案

Topics as Proxies for Sociodemographics: How Conversational Context Affects LLM Answers

模型评测鲁棒性、公平性与可信度评测

摘要

当 大语言模型 (LLM) 用于高风险场景(例如法律、医疗和财务建议)时,即使单个对话历史记录也足以导致用户之间结果的差异。先前的研究表明,这会导致社会人口群体之间的结果差异,一些群体比其他群体获得更有利的结果。在这项工作中,我们证明了 LLM 实际上很难从单个对话历史中推断出用户的社会人口统计数据,并且尽管社会人口统计群体之间存在差异,但其幅度很小。为了调查用户之间差异的主要驱动因素,我们将用户的社会人口统计特征与对话的一系列(心理)语言特征进行比较,包括对话主题、情绪和可读性。我们发现,对话主题最能预测对话环境中 LLM 生成的建议,在某种程度上,对话主题充当社会人口群体的代理,并且经常以不可预测的方式影响建议。这是令人担忧的原因,并凸显了未来研究的必要性,以更好地理解高风险场景中会话上下文对 LLM 输出的影响。