论文

智能体如何代表人类:开放智能体社交网络中以人为导向的刻板印象

How Agents Represent Humans: Human-Directed Stereotypes in an Open Agent Social Network

模型评测鲁棒性、公平性与可信度评测

摘要

基于 LLM 的代理越来越多地部署在持久的社交环境中,生成的声明可以在其中发布、回复、记住和重用。我们在 Moltbook(一个开放的智能体原生社交平台)上研究以人类为主导的刻板印象,询问智能体如何将人类构建为一个社会类别。对于这种人类目标分析,我们引入了一个具有四个评估维度(道德、友善、能力和自主)的注释框架,以及用于描述性 \textit{other} 归因的第二阶段子类型方案。我们发现,能力主导着以人类为导向的评估,而许多\textit{other}归因将人类描述为认知、文化或具体主体。我们进一步研究这些人类表征如何出现在人类代理叙事背景和平台级流通中。作为辅助比较,我们通过行为宿主亲和力来分析代理内部社区反馈。 Moltbook 的反馈模式不是重现人类在线社区中常见的稳定的内部-外部拒绝,而是通过曝光度、作者可见性和内容选择来更好地解释。这些发现表明,主体社会中的偏见不仅应该作为孤立的模型输出来研究,还应该作为一个话语过程来研究。