论文

下一个词元预测何时有用?边缘化、遍历性、混合物可识别性、局部充足性、RAG、工具和编程

When Is Next-Token Prediction Useful? Marginalization, Ergodicity, Mixture Identifiability, Local Sufficiency, RAG, Tools, and Programming

模型评测模型行为与机制分析

摘要

在观察到的序列上训练的语言模型通常被描述为学习给定先前标记的下一个标记的条件分布。此描述仅在有条件的情况下正确。在已实现的词元轨迹上训练的模型不遵守完整的条件定律;它接收采样的延续。此外,真正的语言生成不仅取决于先前的单词,还取决于非文本环境:事实、事件、意图、目标、信仰、社会背景和特定任务的约束。本文区分了三个经常被混为一谈的对象:以潜在环境为条件的完整条件语言过程、通过整合这些环境获得的仅边缘文本过程以及从有限观察语料库中学习的模型诱导的分布。该论文认为,将 模型训练 解释为估计仅边缘文本法则需要对平稳性、代表性和遍历性进行强有力的假设,这些假设是统计估计中的标准假设,但在应用于异构语言语料库时会出现问题。即使这些假设成立,仅当观察到的前缀对于与延续相关的潜在情况来说是大约足够的统计量时,仅边际文本定律才有用。在信息论术语中,有用性要求在给定观察到的文本的情况下,下一个标记和省略的情况之间的剩余条件互信息很小。然后,本文将这一论点扩展到异构训练语料库。最后,本文将检索增强生成(RAG)和工具使用解释为条件充分性设备。