论文

信息阴影:衡量语言模型可以学习的结构限制

The Information Shadow: Measuring Structural Limits on What Language Models Can Learn

模型评测模型能力评测

摘要

语言模型所知道的一些限制不是数据覆盖范围的差距,而是从文本中学习的结构特性。我们引入了信息阴影:文本训练的学习者无论规模如何都无法获取的现象区域,包括(I)语言无法表达的结构,(II)从训练分布中统计上不可识别的函数,以及(III)基于梯度的训练可表示但无法达到的函数。我们为每种类型提供了一个具有决定性的探索,因为在这种情况下,影子的前提是可证明的。对于类型 I,语言压缩残差将文本学习器(仅看到信号的有损文本式编码)与全信号学习器(直接看到底层信号)进行比较。文本学习器处于可计算的表达能力上限,而全信号学习器则在 300 倍以上的数据中保持平坦的差距,因此缺陷是通道的属性,而不是训练的属性。对于类型 II,反事实区分测试根据与两个不兼容规则完全一致的数据训练模型。在可证明的字符串任务和类似语言的一致性任务中,反事实的行为由模型的归纳偏差设定,而 5% 的消歧数据将学习的规则双向引导到任一目标(r = +/-1.0,p < 1e-10)。对于类型 III,盆地逃逸映射展示了一个可以 100%(通过手工构建)表示的函数,但通过标准训练并立即从附近的初始化达到 0% 的时间,宽度缩放没有提供任何帮助 (p = 1.6 x 10^-14)。每个效果都通过排除容量或模态伪影的控件来隔离。我们发布了探针套件并讨论了对基准设计、能力审计和影子感知不确定性的影响。