论文

CultureForest:理解和评估 LLM 中的文化规范基础推理

CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs

模型评测基准与评测资源

摘要

现有的研究很大程度上将LLM中的文化智能简化为知识层面的问题,而忽略了模型是否能够在现实场景中有效地利用其所获得的知识。为了弥补这一差距,我们引入了 CultureForest,它是 \textit{文化规范基础推理} 的基准。每个问题都基于一小组原子规范,从而实现可验证和可归因的评估。 CultureForest包含跨越8个领域和53个国家/地区的5,378个示例,并支持从多项选择到开放式生成的渐进式评估。大量实验表明,即使是顶级模型在开放式环境中也会大幅退化,并伴有明显的跨区域差异。通过有针对性的分析,我们发现了几个一致的模式:(1)测试时推理收益有限,并可能加剧不平等; (2)模型表现出高度共享的区域偏好结构; (3)模型反应明显保守,尤其是在更严格的文化约束下; (4)通过将文化知识获取与文化推理分开,我们表明,虽然LLM拥有丰富的文化知识,但其性能因其有效使用而进一步受到瓶颈。这些发现表明,必须从以知识为中心的评估转向衡量以知识为基础的推理。