论文
语言模型的交叉熵风险估计:不一致一定是密集的,Holdout方法也不例外
Cross-Entropy Risk Estimation for Language Models: Inconsistency Must Be Dense, and the Holdout Method Is No Exception
摘要
语言模型通过其保留的每个词元交叉熵风险进行比较——数量缩放法则适合。我们表明它不能被一致地估计。一致性或估计值的收敛性是相对于\emph{世界的可能状态}来定义的:由数据生成分布和我们要训练的模型组成的一对。对模型和数据生成机制进行量化至关重要,因为决定模型风险是否可估计的是其权重引起的分布的尾部属性,而没有样本揭示这一点。由于拓扑事实,每个词元的交叉熵风险很难估计:在可能的状态中,有限风险和无限风险都任意接近另一个风险的每个实例。因此,没有一个估计量(不仅仅是保留平均值)在定义风险的每个状态下都是一致的。更糟糕的是,在限制预期序列长度和限制完全支持模型的情况下,不一致的估计仍然存在;在这种受限的环境中,发生不一致的状态甚至是密集的。确定了两种有趣的出路,但都不是免费的。出路一:使用有界上下文窗口,我们可以对模型的下一个标记概率进行下限,当数据生成分布具有有限的预期序列长度时,使其风险精确地成为有限的——这是基于计算的选择的新的统计原理,尽管它所替代的假设本身超出了任何测试的范围。出路二:只有当风险低于预先设定的阈值时才报告风险,这可以恢复一致性,而不需要模型选择实际需要的成本——但我们需要认识到估计的目标已被修改。