论文
行为稳定,变化有限:LLM 城市情感感知代理中的角色有效性
Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception
摘要
大语言模型 (LLM) 在城市分析中越来越多地用作人类感知的代理,但目前尚不清楚角色提示是否会产生有意义且可重复的行为多样性。我们研究不同的角色是否影响多模态 LLM 生成的城市情绪判断。使用涵盖性别、经济地位、政治取向和个性的一组阶乘角色,我们为每个角色实例化多个代理,以评估 PerceptSent 数据集中的城市场景图像,并评估角色内的一致性和跨角色的变化。结果显示共享角色的代理之间具有很强的收敛性,表明行为稳定且可重复。然而,跨角色的差异是有限的:经济地位和个性会引起统计上可检测但实际上适度的变化,而性别则没有显示出可测量的影响,政治取向的影响可以忽略不计。代理还表现出极端偏见,破坏了人类注释中常见的中间情感类别。因此,在粗粒度极性任务上的表现仍然强劲,但随着情绪分辨率的增加而下降,这表明简单的基于标签的角色提示并不能捕捉细粒度的感知判断。为了隔离人物角色调节的贡献,我们另外评估了没有人物角色的同一模型。令人惊讶的是,无角色模型有时会在所有任务变体中匹配或超过与人类标签的角色条件一致性,这表明简单的基于标签的角色提示可能会在此设置中添加有限的注释价值。