论文
通过即时知识调优消除在线行为分析中 大语言模型 社会因素的偏差
Debiasing Large Language Models toward Social Factors in Online Behavior Analytics through Prompt Knowledge Tuning
摘要
归因理论解释了个人如何通过利用个人(性格)和非个人(情境)因果关系来解释和归因社会背景下的他人行为。在人类生成的语料库上进行训练的 大语言模型 (LLM) 可能会隐式地模仿社会环境中的这种社会归因过程。然而,LLM 在推理中利用这些因果归因的程度仍有待探索。尽管使用思维链 (CoT) 等推理范式在各种任务中都显示出了有希望的结果,但在推理中忽略社会归因可能会导致 LLM 在社会环境中做出有偏见的反应。在本研究中,我们研究了将用户的目标纳入知识以推断性格因果关系和消息上下文以推断情境因果关系对 LLM 性能的影响。为此,我们引入了一种可扩展的方法,根据社交媒体消息的上下文和目标,通过使用社交归因知识的两个提示辅助来丰富 LLM 的指令提示,以减轻此类偏差。该方法提高了模型性能,同时减少了 LLM 在行为分析应用的零样本分类任务推理中的社会归因偏差。当考虑到灾害类型和社交媒体多种语言的可变性时,我们凭经验证明了我们的方法在灾害领域社交媒体上的意图检测和主题检测这两项任务中的优势。我们的实验强调了三个开源 LLM:Llama3、Mistral 和 Gemma 对社会归因的偏见,并展示了我们缓解策略的有效性。