论文

语境中的文化能力:大语言模型在芬兰通过图灵测试

Cultural Competence in Context: A Large Language Model Passes the Turing Test in Finland

模型评测模型能力评测

摘要

我们报告在芬兰以芬兰语开展的图灵测试结果。由于大语言模型训练数据中的语言和文化语境分布不均,我们原先预期ChatGPT 5.2在芬兰语测试中会弱于此前研究的美国英语语境。我们还提出由模型生成角色提示的可复现技术,用于开展比较性大模型图灵测试,以改善构念效度。与预期相反,该模型通过了芬兰图灵测试。一个突出的错误来源是参与者依赖语言线索,尤其把芬兰口语当作人类作者标志。我们将图灵测试从智力测试重新界定为一种比较方法,用来考察AI系统能否表现出对某个社会世界可信的成员身份。结果同时反映模型能力、提示塑造的身份、参与者的圈内能力及其AI素养,因此该方法可用于探察不同领域的人机边界。