论文
大模型生成文本的时间变化趋于平坦:人类与大模型写作轨迹比较
Temporal Flattening in LLM-Generated Text: Comparing Human and LLM Writing Trajectories
摘要
大语言模型(LLM)越来越多地用于内容生成、代码编写等日常应用,其中每次交互往往将模型视为无状态系统,使其独立生成回答、不保留记忆。然而,人类写作本质上具有纵向变化:作者的风格和认知状态会在数月、数年间演变。因此,核心问题是大模型能否重现这种长期时间结构。研究构建并公开了一个纵向数据集,包含412名人类作者的6,086篇文档,覆盖2012–2024年的学术摘要、博客和新闻三个领域。研究比较了这些人类写作轨迹与三种代表性大模型在标准独立生成及以历史为条件生成设置下产生的轨迹。基于语义、词汇和认知情绪表征的漂移与方差指标,研究发现大模型文本存在时间变化趋于平坦的现象。模型的词汇多样性更高,但语义和认知情绪漂移明显小于人类。仅依赖时间变化模式即可区分人类与模型轨迹,准确率为94%,ROC-AUC为98%。无论模型独立生成,还是能够访问逐步增加的历史文本,该现象都持续存在,反映了当前部署方式的一项特征。这一差距影响需要真实时间结构的应用,例如合成训练数据与纵向文本建模。