论文
解码AI作者身份:LLM能否真正在文学和政治领域模仿人类风格?
Decoding AI Authorship: Can LLMs Truly Mimic Human Style Across Literature and Politics?
摘要
随着生成式人工智能模仿特定人类风格的能力不断增强,本研究调查了最先进的 大语言模型 (LLM)(包括 GPT-4o、Gemini 1.5 Pro 和 Claude Sonnet 3.5)模仿著名文学和政治人物(沃尔特·惠特曼、威廉·华兹华斯、唐纳德·特朗普和巴拉克·奥巴马)的作者签名的能力。利用具有严格主题对齐的零样本提示框架,我们生成了通过结合基于 Transformer 的分类 (BERT) 和可解释机器学习 (XGBoost) 的补充框架进行评估的合成语料库。我们的方法整合了语言查询和字数统计 (LIWC) 标记、困惑度和可读性指数,以评估人工智能生成的文本和人类创作的文本之间的差异。结果表明,人工智能生成的模仿仍然具有很高的可检测性,XGBoost 模型在一组有限的八个风格特征上进行训练,达到了与高维神经分类器相当的准确性。特征重要性分析将困惑度确定为主要判别指标,揭示了人工智能输出的随机规律性与人类写作的较高变异性相比存在显着差异。虽然 LLM 在低维启发式特征(例如句法复杂性和可读性)上表现出与人类作者的分布收敛,但它们尚未完全复制人类创作的语料库中固有的微妙的情感密度和风格差异。通过隔离当前生成模仿中的具体统计差距,本研究为 LLM 风格行为提供了全面的基准,并为数字人文和社交媒体中的作者归属提供了重要的见解。