论文
从文本语料库学习人类语言的形式限制
A Formal Limitation on Learning Human Language From Textual Corpora
摘要
听者能否仅通过话语形式了解说话者的意思?我们从信息理论上回答这个问题,并针对任何文本特征器给出的听众,包括当代 大语言模型 的隐藏状态。将语言使用建模为含义、上下文和话语的联合分布,我们推导出解码器从话语的表示中恢复说话者的预期含义的概率上限。这些界限受到形式留下的意义的不确定性的控制,意义分裂为不可简化的部分和只有(语言外的)上下文(但永远不能单独表达)可以解决的部分。因为这些数量是语言所固有的,所以无论产生多少文本或监督,任何表征都无法超越它们。无论意义空间是离散的还是连续的,界限都成立。人工语言、普通话零代词解析和颜色参考的实验为该理论提供了经验证据。