论文

超越“AI语言”:LLM输出的语言性质案例

Beyond "AI Language": The case for the idiolectal nature of LLM output

模型评测模型行为与机制分析

摘要

虽然 大语言模型 输出经常被分析为一种称为“人工智能语言”的集体超级变体,但本章认为这种观点与类似于人类白语的独特的、特定于模型的语言签名共存。我们分析了 LLM 生成的有关社会主题的文本的两个数据集:包含六个模型的 2024 年语料库(Improta 等人,2024 年)和使用具有六个当代模型的相同提示新生成的 2026 年语料库。我们的研究结果利用计算描述符和风格主成分分析揭示了 2024 年和 2026 年群体风格之间的代际转变,同时证明每个模型都保持着独特的语言特征。这种多层次的相互作用可以通过收缩频率来说明,在同一组模型中,收缩频率从每百万单词 1,200 到超过 30,000 不等(2026 年)。最终,我们得出的结论是,将 LLM 输出视为本质上的方言提供了一个有价值的框架,对变异和变化、LLM 生成的文本检测、法庭语言学和基于使用的语言方法的研究具有潜在影响。