内知无外在:探寻古典汉语语言模型的泛化边界
Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model
摘要
我们在包含 15.6 亿个纯古典汉语标记的精选语料库(其中英文字符或阿拉伯数字为零)上从头开始训练 318M 参数的 Transformer 语言模型。通过系统的分布外(OOD)测试,我们询问模型是否区分已知输入和未知输入,以及是否在生成的文本中表达了这种区别。我们发现内部和外部不确定性之间存在明显的分离。在内部,该模型在真实历史事件和虚构历史事件之间表现出 2.39 倍的困惑跳跃比(p = 8.9e-11,n = 92 每组),其中半虚构事件(真实人物 + 虚构动作)显示出最高的困惑度(4.24x,p = 1.1e-16),证明了超越句法模式匹配的真正事实编码。然而,从外部来看,该模型从未学会表达不确定性:古典中文认知标记在 OOD 问题中的出现率 (3.5%) 低于分布内问题 (8.3%,p = 0.023),反映了训练数据中的修辞惯例,而不是真正的元认知。我们在三种语言(文言文、英语、日语)、三种书写系统和八个从 110M 到 1.56B 的模型中测试了这两项发现。内部事实编码效应在八个模型中的六个中复制,并随着规模出现(两个最小的日本模型尚未将真实历史与捏造历史分开),而外部不确定性表达的缺失在所有八个模型中都存在。我们进一步表明,不确定性表达频率完全由训练数据约定(而不是认知状态)决定,中国古典模型表现出“谦逊悖论”(对已知主题进行更多对冲),而日本模型几乎从不对冲。我们认为,元认知表达——说“我不知道”的能力——不仅仅来自语言建模,并且需要诸如 RLHF 等明确的训练信号。