论文

多模式城市感知中的角色提示:描述性趋同和解释性变异

Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

模型评测模型行为与机制分析

摘要

本研究探讨了角色提示如何塑造城市感知中两种多模态 大语言模型 生成的语言,这是一种检查共享视觉证据的主观解释的环境。我们将输出组织为三个功能层:描述性基础(描述文本)、中间语义层(感知标签)和解释性框架(理由)。使用来自两个 MLLM(Qwen3-VL 和 Gemma4)的大约 60,000 个角色条件注释,我们发现描述文本在角色配置文件中强烈收敛,并且仅显示很小的属性相关差异。理由差异更大:经济地位在两种模型中产生最大的差异,政治倾向和个性也很突出。配对图像级比较证实了这三个属性比描述文本差异更大的合理性。对于感知标签,共享相同属性级别的角色比具有不同属性级别的角色产生更多相似的标签集,其中观察到的经济状况的最大分离。探索性主题分析进一步表明针对特定角色的评估重点。在模型中,配置文件对相似性模式与所有三种输出类型都密切相关,尽管在理由方面一致性最低。总体而言,角色提示对解释框架的影响比描述性基础更强烈。