论文

亚当定律:大语言模型 上的文本频率定律

Adam's Law: Textual Frequency Law on Large Language Models

模型训练合成数据

摘要

虽然文本频率已被证实与人类阅读速度认知相关,但其与 大语言模型 (LLM) 的相关性却很少被研究。据我们所知,我们在文本数据频率方面提出了一个新颖的研究方向,这是一个尚未充分研究的主题。我们的框架由三个单元组成。首先,本文提出了文本频率定律(TFL),该定律表明LLM无论是提示还是微调都应优先考虑频繁的文本数据。由于许多 LLM 的训练数据是闭源的,因此我们建议使用在线资源来估计句子级频率。然后,我们利用输入释义器将输入转述为更频繁的文本表达。接下来,我们通过查询 LLM 来提出文本频率 蒸馏 (TFD),通过进一步扩展数据集中的句子来完成故事,并使用得到的语料库来调整初始估计。最后,我们提出课程文本频率训练(CTFT),以句子级频率的递增顺序微调 LLM。我们在我们精心策划的数据集文本频率配对数据集 (TFPD) 上进行了有关数学推理、机器翻译、常识推理和代理工具调用的实验。结果显示了我们框架的有效性。