论文

人工智能正在赶上人类的表达能力吗?用六个 大语言模型 探索英语和阿拉伯语的情感、个性、作者身份和语言风格

Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Models

模型评测模型能力评测

摘要

LLM 日益提高的流畅性引发了关于它们在不同语言和文化背景下模仿复杂人类特征(包括情感表达和个性)的能力的重要问题。本研究调查 LLM 是否能够令人信服地模仿英语中的情感细微差别和阿拉伯语中的个性标记,阿拉伯语是一种资源贫乏的重要语言,具有独特的语言和文化特征。我们在六个模型中执行两项任务:Jais、Mistral、LLaMA、GPT-4o、Gemini 和 DeepSeek。首先,我们评估机器分类器是否能够可靠地区分人类创作的文本和人工智能生成的文本。其次,我们评估 LLM 生成的文本表现出与人类相当的情感或人格特征的程度。我们的结果表明,人工智能生成的文本与人类创作的文本有区别(F1>0.95),尽管分类性能在释义样本上恶化,表明对肤浅文体线索的依赖。情感和性格分类实验揭示了显着的泛化差距:在人类数据上训练的分类器在人工智能生成的文本上表现不佳,反之亦然,这表明 LLM 编码情感信号的方式与人类不同。重要的是,利用人工智能生成的数据增强训练可以提高阿拉伯语个性分类任务的性能,突显合成数据在解决资源贫乏语言挑战方面的潜力。特定模型的分析表明,GPT-4o 和 Gemini 表现出卓越的情感一致性。语言学和心理语言学分析揭示了人类和人工智能文本在语气、真实性和文本复杂性方面存在可测量的差异。这些发现对情感计算、作者归属和负责任的人工智能部署具有影响,特别是在资源匮乏的语言环境中,生成式人工智能检测和对齐提出了独特的挑战。