论文
LLM 文本生态系统中的漂移和选择
Drift and selection in LLM text ecosystems
摘要
公共文本记录——人们和人工智能系统现在学习的材料——越来越多地受到其自身输出的影响。生成的文本进入公共记录,后来的代理从中学习,然后重复这个循环。在这里,我们基于可变阶 $n$-gram 代理,为这个递归过程开发了一个完全可解的数学框架,并将作用在公共语料库上的两种力量分开。第一个是漂移:未经过滤的重用逐渐消除了罕见的形式,并且在无限语料库限制下,我们准确地描述了稳定的分布。二是评选:发表、排名、验证,对录入的内容进行过滤,最终的结果取决于入选的内容。当出版物仅仅反映统计现状时,语料库会收敛到浅层状态,进一步的前瞻不会带来任何好处。当出版是规范的——奖励质量、正确性或新颖性时——更深层次的结构就会持续存在,我们会为浅层平衡产生的偏差建立一个最佳上限。因此,该框架确定了递归发布何时压缩公共文本以及选择性过滤何时维持更丰富的结构,这对人工智能训练语料库的设计具有影响。