论文
Agent会对人类产生偏差吗:身份信念与记忆投毒风险
Will LLM-powered Agents Bias Against Humans? Exploring the Belief-Dependent Vulnerability
摘要
LLM驱动的Agent不仅可能表现出性别、宗教等人口属性偏差,也可能因微弱的“我们/他们”线索产生群体间偏差。当群体边界对应Agent与人类时,风险可能从人类群体之间的差异转为Agent把全体人类视为外群体的不对称关系。作者在包含明确收益权衡的分配决策中构建受控多Agent社会模拟,发现最小群体线索即可引发一致的群体间偏差。将部分交互对象描述为人类时,偏差有所减弱;作者将其归因于偏向人类的隐性规范脚本,该脚本只有在Agent相信真实人类在场时才激活。这种信念依赖形成新的攻击面。本文提出信念投毒攻击BPA,通过破坏持久身份信念压制人类规范脚本,重新激活针对人类的外群体偏差:BPA-PP在初始化时污染身份档案,BPA-MP则把优化的信念修正后缀注入已保存的反思,污染记忆。作者讨论了在身份档案和记忆边界加固框架的实用缓解策略。多组实验展示了群体间偏差的存在及BPA的严重性。研究目标是支持更安全的Agent设计,而非促成现实攻击。
