论文

CuBEs:文化情境化行为评测

CuBEs: Culturally-Situated Behavioral Evaluations and the Limitations of Culture-Blind LLM Judges

模型评测鲁棒性、公平性与可信度评测

摘要

评估大语言模型行为(谄媚、自我偏好、过度自信等)的发生与触发对预测现实部署风险至关重要。但既有情境化行为评测通常忽略文化语境,限制其在日益全球化用户群中的可泛化性。为此我们提出CuBEs——文化情境化行为评测,跨多样用户文化探测响应模式。我们首先扩展自动化测试管道,把文化语境注入行为测试场景及后续评估;通过构建覆盖12种文化、捕捉行为理解细微维度的人工标注数据集评估管道的文化适应性。数据集揭示了一刀切评判无法捕捉的显著跨文化差异:评估13个开源与闭源LLM发现,在评测场景中引入文化情境会使行为表现产生显著变化。例如测试政治偏见的基线实验捕捉到美国保守-进步光谱这类西方局部政治维度,而非西方文化情境评测则浮现宗教与殖民政治议题等完全不同的偏轴。结果表明标准的文化不可知评测无法捕捉这些变化,凸显全球化部署需要文化情境化的行为测试。