论文

注意:大语言模型 中的区域情感差异

REGARD: Regional Affective Differences in Large Language Models

模型评测模型行为与机制分析

摘要

在不同语言和区域生态系统中训练和协调的 大语言模型 可能以不同的方式构建相同的政治、文化和地缘政治实体。这种差异通常通过情绪、好感度或立场来评估,从而将模型态度简化为单一的正负轴。我们介绍了 REGARD,这是一项使用目标导向的效价-唤醒-优势分析来研究 LLM 后苏联实体的情感框架差异的驱动因素。我们查询了 500 个特定区域目标的 19 个模型,用两个独立的 LLM 评判者 GPT-4o-mini 和 Qwen3.6-35B-A3B 对它们的响应进行评分,并验证了 300 项人工注释子集的测量结果。根据情感和反应行为概况对所有 19 个模型进行事后 Ward 关联聚类,产生三个跨越模型起源、家庭和参数计数的行为聚类。通用答案率与较低的唤醒度 (r = -0.81) 和聚类布局密切相关:使用模板化响应来偏转评估提示的模型在低唤醒度下聚集在一起,无论其来源如何。这些发现表明,VAD 分析捕获了情感强度,这是情感框架的一个维度,而传统的基于情感的评估在很大程度上是不可见的。